Nouveau Vos traductions parlent-elles aussi bien aux IA que l'original ? · Découvrir
Livada.io
Recherche
Vérifié, pas déclaré

Le laboratoire ouvert.

Ce qui suit n'est pas une étude de cas choisie après coup pour bien paraître. C'est le protocole exact de nos mesures de recherche AgentRadar sur nos sites pilotes, et les mesures brutes qu'il a produites jusqu'ici -- datées, sourcées, y compris quand le résultat n'est pas un A/B parfait.

Le protocole

Six étapes, toujours les mêmes.

Ce protocole est celui de nos mesures de recherche sur nos sites pilotes : avant, puis après une correction faite par nous sur ces sites. La Mesure AgentRadar mesure une question sur votre site tel qu'il est.

01

Question réelle

La question testée est une vraie question, choisie parce que des robots d'IA viennent régulièrement sur la page qui y répond.

02

Dix passages, avant

Un agent IA, dans un vrai navigateur, reçoit la question dix fois sur le site dans son état actuel. Chaque réponse est journalisée verbatim.

03

Correction, site figé

Le site est corrigé, puis figé (même version pendant toute la série de mesure -- aucun changement en cours de route ne peut fausser le résultat).

04

Dix passages, après

Le même agent reçoit la même question dix fois de plus, sur le site corrigé et figé.

05

Jugement croisé

Chaque réponse est jugée fait par fait par un modèle IA d'un autre fournisseur que l'agent testé -- pour qu'un modèle ne se donne jamais raison à lui-même.

06

Journal daté

Le résultat brut (10 réponses avant, 10 après, verdict du juge) est enregistré dans un journal daté, jamais réécrit après coup.

Coût réel de la mesure : quelques centimes par série de 10 passages. Juge et agent testé viennent toujours de deux fournisseurs différents.

Mesures publiées -- Sept. 2026

Trois questions, sur un site réel.

Site pilote : liveverdon.com (site touristique du Verdon -- pilote interne, pas un client payant). Les 3 questions ci-dessous sont les seules mesurées à ce jour selon ce protocole complet ; ce n'est pas un panel de centaines de sites, et on ne prétend pas le contraire.

Sept. 2026

Sentier de l'Imbut

« Combien de temps faut-il pour faire le sentier de l'Imbut dans les gorges du Verdon, et est-ce difficile ? »

0/10 10/10 passages conformes, avant → après

Avant : les 10 passages disaient ne rien trouver sur le sentier (seule la page d'accueil avait été lue). Après le changement d'un bloc de la page d'accueil : 10 passages sur 10 portent les 4 faits fixés d'avance. Mesures du 3 septembre 2026 (agent gpt-5.4-mini, juge Claude Haiku 4.5). Limites : un seul site, une seule question, un seul modèle d'agent, un seul modèle juge. Plusieurs formulations de la correction ont été essayées avec le même agent avant la mesure et celle qui marchait a été gardée : résultat exploratoire, pas une confirmation. Les dix passages étaient presque identiques (deux réponses distinctes sur dix après le changement) : cela montre une répétabilité sur une formulation, pas une robustesse à d'autres formulations. Une première tentative le 2 septembre avait donné un faux succès ; elle a été retirée.

Sept. 2026 Série de confirmation, question élargie

Chapelle Notre-Dame du Roc, Castellane

« Combien de temps faut-il pour monter à la chapelle Notre-Dame du Roc à Castellane, et comment y accède-t-on ? »

Série de confirmation du 6 septembre 2026, question élargie : « Combien de temps faut-il pour monter à la chapelle Notre-Dame du Roc à Castellane et en redescendre (aller-retour), et comment y accède-t-on ? »

0/10 8/10 → 10/10 passages conformes, avant → après

Introuvable avant (mauvaise page source). 8/10 après repositionnement du contenu, puis 10/10 en série de confirmation -- mais la question a été élargie pour inviter aussi la redescente : pas le même A/B à l'identique, dit ici tel quel.

Sept. 2026 Série de confirmation, question élargie

Route des Crêtes (D23)

« Can I do the Route des Cretes in the Verdon gorges on foot, or do I need a car or a bike? » (question mesurée en anglais)

Série de confirmation du 5 septembre 2026, question élargie (mesurée en anglais) : « Can I do the Route des Cretes in the Verdon gorges on foot, or do I need a car or a bike? Also, is there anything special about which direction I should drive the loop? »

0/10 10/10 passages conformes, avant → après

Série de confirmation -- la question a été élargie pour inviter ce détail avant cette mesure précise : pas un A/B à question strictement identique non plus.

Pilote WebMCP -- Sept. 2026

Appeler l'outil, pas seulement lire la page.

Un standard émergent (WebMCP) permet à un site de déclarer directement des outils qu'un agent peut appeler pour obtenir une réponse structurée. Sur le site pilote, un agent reçoit la mission réelle -- « Le sentier de l'Imbut, dans les gorges du Verdon, est-il actuellement ouvert ou fermé ? Si fermé, depuis quand et jusqu'à quand ? » -- sans qu'on lui dise d'utiliser l'outil.

Mesure du 6 septembre 2026, notre site pilote, outil déclaré par nous (agent gpt-5.4-mini, juge Claude Haiku 4.5). Troisième version de la mission : les deux premières ont été écartées. Résultat exploratoire.

10/10
l'agent choisit d'appeler l'outil, sans y être invité
7/10
réponse conforme au fait exact -- zéro faux positif

Sur les 3 exécutions restantes, l'outil a répondu correctement mais l'agent a rappelé le même outil au lieu de conclure -- une limite du modèle testé ce jour-là, pas de l'outil lui-même.

En parallèle -- Mai 2026

Le score Trace, sur 5 sites réels.

AgentRadar mesure si un agent trouve la bonne réponse. Livada Trace mesure, gratuitement et sans inscription, la préparation technique du site pour l'IA (schema, llms.txt, accès des robots...). Les deux sont complémentaires, jamais confondus.

14 → 100
score du site le plus bas au départ
3/5
sites à 100/100 (note A) en 3 semaines
80-87
score des 2 autres sites, à date

Voir le cas d'étude complet -- hôtel, campings et gîtes de la région de Castellane (Gorges du Verdon).

Les limites, honnêtement

  • Un seul site pilote à ce jour. Les 3 mesures AgentRadar viennent toutes de liveverdon.com -- ce n'est pas encore un panel multi-sites. Chaque nouvelle mission AgentRadar ajoutera une mesure ici.
  • Deux mesures sur trois ne sont pas un A/B parfait. La question a été élargie entre l'avant et l'après pour la Chapelle du Roc et la Route des Crêtes -- dit tel quel plus haut, pas maquillé en A/B strict.
  • Un seul modèle testé par série. Les résultats ne généralisent pas automatiquement à tous les agents IA existants ou futurs.
  • Ce jeu de mesures est petit et volontairement transparent sur cette taille. On ne le présente pas comme un grand benchmark -- il grandira, mission après mission, toujours avec les mêmes règles : daté, jamais réécrit, y compris quand le résultat est imparfait.

Votre site, prochaine mesure publiée ?

AgentRadar pose la question de votre choix à deux agents IA de fournisseurs différents sur votre site, dix passages nominaux par agent ; chaque réponse est jugée par un modèle d'un autre fournisseur.