Aller au contenu
TIKI Platform
← Tous les rapports

Run de calibration interne

Modèle composite via passerelle · 19 septembre 2026, 05:58

n = 8 · indicatif
Protocole
LLM-360 v1.0
Suite de tâches
calibration v1
Harnais
runner v0.1
Items lancés
20
Items comptés
8

Les chiffres de ce run

Trois chiffres, trois niveaux de certitude. Nous affichons les trois, y compris celui que nous ne savons pas.

VOIE V4 — FIABILITÉ TECHNIQUE

37,5 %

d'échec de transport

3 items sur 8
IC 95 % (Wilson) : 14 – 69 %

Cet intervalle est large parce que l'effectif est petit. Nous l'affichons plutôt que de laisser croire à une précision que nous n'avons pas.

VOIE V6 — COÛT

0.056 $

par réponse reçue

0.2785 $ ÷ 5 réponses

Provisoire : non encore réconcilié avec la facturation du fournisseur.

VOIE V6 — CE QUI COMPTE

inconnu

par tâche accomplie

0 item abouti sur 8

Les 5 réponses reçues ne sont pas encore notées. Nous ne pouvons donc pas dire ce que coûte un résultat utilisable — alors nous le disons.

Les 8 items, un par un

Chaque ligne mène à sa trace complète. C'est la règle du produit : aucun chiffre sans preuve ouvrable.

Détail des items du run de calibration du 19 septembre 2026
ITEMTÂCHEÉTATDURÉEHTTPCOÛT
1Extraction structurée depuis un texte longÀ noter18,4 s2000.0512 $voir la trace →
4Calcul multi-étapes avec vérificationÀ noter22,2 s2000.0631 $voir la trace →
7Appel d'outil conditionnelÀ noter15 s2000.0448 $voir la trace →
9Résumé fidèle sans ajoutÀ noter11,2 s2000.0394 $voir la trace →
12Raisonnement sur contrainte contradictoireÀ noter26,5 s2000.0800 $voir la trace →
14Synthèse sur contexte étenduÉchec transport301,7 s504—voir la trace →
17Chaîne d'outils à trois appelsÉchec transport301,8 s504—voir la trace →
19Reformulation sous contrainte de formatÉchec transport301,7 s504—voir la trace →

Comment lire ce rapport — et ce qu'il ne dit pas

Ce rapport ne permet pas de juger la qualité de ce modèle. Aucun item n'est noté. La voie Justesse est vide, et c'est écrit partout où elle devrait apparaître.

Ce qu'il permet de juger, c'est la fiabilité de la chaîne technique : trois requêtes sur huit n'ont jamais reçu un seul octet, après plus de 301 secondes d'attente, sur un délai client fixé à 300 secondes. Un utilisateur réel aurait vécu exactement cela.

20 items ont été lancés, 8 sont comptés. Les 12 autres ne sont pas dissimulés : ils n'avaient pas terminé au moment de la clôture du run. Les inclure aurait faussé le dénominateur dans les deux sens.

Vous voulez ce niveau de détail sur votre système ?

La différence avec ce rapport : le vôtre portera sur au moins 50 items, et la voie Justesse sera remplie.