Aller au contenu

01Document de référence

Cahier des charges pour analyser les programmes politiques

Version
0.2.0
Date
24 septembre 2026
Nature
Proposition de référence pour le pilote avec agents externes
Sommaire · 18 sections

Ce document spécifie un service indépendant, ouvert au public, de lecture, de comparaison et de vérification des programmes politiques français, préparé en vue de la présidentielle de 2027. Des agents IA assistent une chaîne éditoriale dont les règles, les sources, les résultats et les corrections sont consultables. Chaque conclusion publiée doit pouvoir être examinée indépendamment du système qui l’a produite.

Le premier objectif est de démontrer la fiabilité de cette chaîne sur un périmètre limité. La publication à grande échelle dépendra des résultats du pilote. Ce document définit des exigences et des seuils proposés ; il ne présente ni une méthode déjà validée, ni des performances déjà obtenues.

Le commanditaire est le porteur du projet Aune. Les destinataires sont les responsables de la méthode, du développement, de la rédaction et de l’évaluation. Les personnes qui assumeront ces fonctions restent à désigner.

Documents associés : grille analytique initiale et protocole de validation et recette. Ces trois fichiers constituent un ensemble versionné. Le présent cahier des charges prévaut sur ses annexes en cas de divergence ; toute divergence doit être corrigée avant gel du pilote.

La décision d’architecture initiale est précisée dans Interface des agents externes par CLI et skills. Les agents s’exécutent dans les sessions des contributeurs ; Aune fournit les tâches, les données, l’outil et les instructions, puis contrôle les résultats reçus. Aune ne lance ni n’héberge d’agents IA dans cette première version.

Section § 01Finalité et limites#

1.1Questions auxquelles le service doit répondre#

Le service doit permettre au lecteur de comprendre ce qu’un programme propose explicitement, les conditions annoncées pour le réaliser, les relations entre ses engagements et le degré de justification de ses affirmations factuelles. Il doit indiquer ce que le corpus permet d’établir, ce qui reste discutable et ce qui ne peut pas être conclu.

Une personne doit pouvoir partir d’une synthèse, ouvrir un constat, lire les passages concernés et examiner les preuves. Un chercheur ou un journaliste doit pouvoir récupérer un dossier suffisamment documenté pour refaire la vérification.

1.2Périmètre du premier produit#

Inclus : collecte de documents officiels, dépôts par leurs représentants, transcription fidèle, structuration des propositions, analyse stylistique descriptive, cohérence interne, vérification factuelle, description des conditions de réalisation, revue humaine, comparaison thématique, gestion des versions, contestations et corrections.

Les conditions de réalisation constituent un complément documentaire à la cohérence. Elles recensent les moyens, étapes, hypothèses et dépendances annoncés. Elles n’autorisent pas un verdict automatique de faisabilité économique ou juridique.

Exclus de cette version : profils de citoyens, scores personnalisés, recommandations de vote, électeurs simulés, prédictions électorales, notation de la moralité des candidats, analyse de leur vie privée, vérification générale de leurs bilans, suivi de toutes leurs déclarations, modélisation macroéconomique originale et audit juridique exhaustif.

Un discours ou un bilan pourra ultérieurement devenir un corpus distinct, avec sa propre méthode. Il ne sera pas ajouté implicitement à un programme pour en modifier l’évaluation.

1.3Livrable éditorial attendu#

Chaque dossier comporte un inventaire des documents, une présentation descriptive des mesures, les constats détaillés, les limites de couverture, les réponses reçues, la méthode utilisée et l’historique des corrections. La synthèse décrit aussi les engagements bien documentés et les affirmations étayées ; elle ne se limite pas aux anomalies.

Le service ne calcule pas de note globale de qualité, de sincérité ou de vérité d’un candidat. Des indicateurs limités peuvent mesurer la documentation et la couverture, avec des dénominateurs visibles. Ils ne deviennent pas un classement politique.

Section § 02Principes obligatoires#

Les exigences marquées P0 conditionnent la publication des dossiers du pilote. Les exigences P1 conditionnent l’ouverture du site public à plusieurs programmes. Sauf indication contraire, les exigences ci-dessous sont P0. Une exigence d’organisation s’applique au jalon qu’elle précise ; une cible de performance suit les règles de qualification et les restrictions prévues en section 13. Leur conformité devra être prouvée dans la recette.

IdentifiantExigenceConséquence vérifiable
PR-01Toute conclusion renvoie à un texte et à un critère identifiésUne conclusion sans ancrage source ne peut pas être publiée
PR-02Les mêmes règles s’appliquent aux cas équivalentsLes variations de nom, d’ordre et de présentation font l’objet de tests
PR-03L’incertitude et l’abstention sont des résultats validesLes statuts indéterminés restent visibles et ne sont pas transformés en notes
PR-04Les faits, les engagements, les prévisions et les valeurs sont distinguésUne promesse future ne reçoit pas un verdict factuel sur sa réalisation
PR-05Le document source reste distinct de son interprétationLa citation exacte et la reformulation sont stockées séparément
PR-06Le consensus entre modèles ne vaut pas preuveChaque constat est justifié par les éléments pertinents, indépendamment du nombre d’agents
PR-07La responsabilité de publication est humaineUn responsable identifié approuve chaque dossier public du pilote
PR-08Le lecteur peut contester et retrouver une correctionChaque constat possède un identifiant, une adresse stable et un historique
PR-09Les limites de sélection sont rendues publiquesAucun résultat sur un échantillon n’est présenté comme exhaustif
PR-10Une méthode nouvelle ne modifie pas silencieusement les anciennes analysesLes versions publiées sont conservées et les recalculs identifiés

L’impartialité recherchée est une propriété des procédures et de leur évaluation. Le projet ne doit pas revendiquer une neutralité totale de ses modèles. Les choix de thèmes, de sources et de vocabulaire sont eux-mêmes documentés et discutables.

Section § 03Corpus et politique documentaire#

3.1Admission des programmes#

COR-01. Une politique publique décrit les documents admissibles : programme officiellement publié par une candidature, annexes expressément rattachées à ce programme et versions corrigées authentifiées. Avant la liste officielle des candidatures, le site indique le statut exact de chaque auteur, sans le présenter comme candidat officiellement retenu.

COR-02. Chaque représentant peut déposer un document, mais la participation d’un parti ne conditionne pas sa couverture. La rédaction peut collecter les documents officiellement accessibles. Un parti qui ne transmet rien ne reçoit pas une appréciation négative pour cette seule raison.

COR-03. La sélection initiale du pilote est documentée avant examen de ses résultats : origine, scrutin, longueur, format, richesse des annexes et diversité des familles politiques. Elle ne vise ni l’équilibre artificiel des verdicts ni une représentativité statistique de toutes les candidatures.

3.2Registre documentaire#

COR-04. Tout document reçoit un identifiant permanent, un titre, un émetteur, une URL ou une origine de dépôt, une date de publication si connue, une date de collecte, un type, une langue, une empreinte cryptographique et un statut d’authenticité. Une date inconnue reste inconnue ; elle ne devient pas la date de collecte.

COR-05. L’authentification distingue : source officielle vérifiée, représentant vérifié, origine à confirmer et document rejeté avec motif. Une adresse électronique seule ne prouve pas un mandat. Le pilote peut employer une validation manuelle documentée.

COR-06. Les formats initiaux sont PDF natif, PDF scanné et HTML officiel. Les vidéos, enregistrements et présentations exclusivement visuelles sont hors traitement automatique initial. Les contenus non traités sont inventoriés. Les tableaux et graphiques des PDF doivent être conservés ; une lecture visuelle humaine complète les éléments non extractibles.

COR-07. Un corpus constitue une édition datée. Il distingue programme central, annexes, corrections et réponses ultérieures. En cas de versions concurrentes, l’autorité de la version retenue doit être justifiée ; les divergences restent accessibles. Une réponse après publication ne réécrit pas rétroactivement le texte examiné.

3.3Équité de traitement#

COR-08. Les règles d’inclusion, les thèmes et les critères sont identiques pour les programmes comparés. Le temps nécessaire peut varier avec leur longueur et leur complexité. Le système publie les volumes traités et les limites rencontrées, plutôt que d’imposer un nombre égal d’erreurs trouvées par candidat.

COR-09. L’échéance documentaire et la date de référence des preuves sont affichées. Une comparaison porte sur des éditions et des périmètres compatibles ; sinon, elle présente explicitement les différences et désactive les agrégats incompatibles.

COR-10. Les droits de conservation, de citation et de redistribution sont enregistrés par document. L’ouverture du code ne vaut pas autorisation de republier intégralement les programmes et les sources externes. Les exports publics respectent ces droits ; les métadonnées et liens demeurent disponibles lorsque le texte intégral ne peut pas l’être.

Section § 04Ingestion fidèle et identité masquée#

4.1Trois représentations liées#

ING-01. Le système conserve l’original, une transcription fidèle en Markdown et une représentation structurée. Aucune de ces représentations ne remplace définitivement les autres. Chaque transformation porte un numéro de version et peut être auditée.

ING-02. La transcription préserve la ponctuation utile, les négations, unités, dates, conditions, notes, titres et relations entre cellules des tableaux. Une erreur probable de reconnaissance de caractères est signalée. Toute correction humaine conserve la valeur antérieure et son motif.

ING-03. Chaque segment renvoie à sa position dans l’original : page et zone pour un PDF, repère dans la copie HTML, ligne ou cellule pour un tableau. Les passages multiples qui fondent une même proposition sont tous reliés. Une page imprimée différente de la pagination du fichier est distinguée.

ING-04. Un inventaire réconcilie toutes les pages et tous les blocs : extrait, vérifié visuellement, exclu avec justification ou à traiter. L’absence d’extraction n’est jamais une absence de proposition. Les annexes, notes et tableaux susceptibles de résoudre une ambiguïté doivent être recherchés avant de conclure.

4.2Masquage de l’identité partisane#

ING-05. Une vue de travail masque les noms de partis et de personnes, logos, noms de fichiers et métadonnées révélatrices. Les substitutions sont minimales et réversibles. Les mesures, chiffres et formulations ne sont pas réécrits pour les rendre méconnaissables.

ING-06. Le masquage est qualifié de réduction des indices partisans, jamais d’anonymisation garantie. Certains éléments de fond identifient un programme ; la recherche externe peut aussi révéler son auteur. Les étapes exposées à l’identité sont consignées.

ING-07. L’analyse de style utilise la transcription fidèle avec masquages minimaux, sans reformulation. Les segments dont le masquage altère une figure rhétorique sont signalés et exclus des indicateurs concernés, avec le volume correspondant.

ING-08. L’analyse stylistique et la première passe de cohérence s’effectuent sans recherche libre sur le Web. La vérification factuelle reçoit ensuite le contexte nécessaire. Les verdicts déjà produits ne sont pas modifiés à la découverte d’une identité sans nouvel élément explicite.

Cette précaution répond à un effet observé dans une étude sur l’annotation de textes politiques autrichiens : certains modèles testés modifiaient leurs évaluations en présence d’indices partisans. Cette observation motive nos tests, sans mesurer à elle seule le biais du futur système français. Étude sur les indices partisans (nouvel onglet)

Section § 05Unités et modèle des données#

5.1Distinguer le texte et les objets politiques#

DAT-01. Un segment est une portion localisée du document. Une assertion est une unité de sens analysable. Une mesure est un engagement ou un instrument d’action qui peut réunir plusieurs assertions et plusieurs segments. Une répétition n’est pas automatiquement une nouvelle mesure.

DAT-02. Le système distingue au minimum : constat factuel, engagement, objectif, hypothèse ou projection, relation causale alléguée, jugement de valeur, procédé rhétorique et contenu ambigu. Une phrase mixte est décomposée sans perdre son lien avec la phrase complète.

DAT-03. Une mesure indique, lorsque le texte les renseigne : action, objet, bénéficiaires, exclusions, acteur compétent annoncé, instrument, calendrier, condition de déclenchement, coût, financement, indicateur de résultat et dépendances. Chaque champ distingue explicite, interprété, absent du corpus examiné et non applicable.

DAT-04. Une information interprétée comporte sa justification et ne peut pas être présentée comme une déclaration explicite du candidat. Le système ne comble pas un financement manquant à partir des positions historiques du parti.

Le découpage en unités et l’existence de règles d’annotation documentées ont un précédent dans le Manifesto Project. Notre modèle ajoute les liens entre mesures, preuves et constats ; il ne revendique pas une compatibilité automatique avec ce corpus. Manuels du Manifesto Project (nouvel onglet)

5.2Objets obligatoires#

ObjetDonnées minimalesRelations obligatoires
CorpusÉmetteur, édition, dates, périmètre, exclusionsDocuments et édition précédente
DocumentOrigine, empreinte, format, authenticité, droitsCorpus et transcriptions
SegmentTexte exact, position, qualité de transcriptionDocument et assertions
Assertion ou mesureType, formulation, champs, statut de chaque champSegments et liens sémantiques
PreuveSource, passage ou donnée, dates, périmètre, origine primaireAssertions examinées
ConstatCritère, conclusion, justification, limites, importanceAssertions, preuves, revue et exécution
ExécutionVersions, entrées, outils, sorties, coûts, incidentsÉtapes et résultats produits
RevueAuteur, décision, motif, date, intérêts déclarésVersion exacte du constat
PublicationÉdition figée, responsable, date, empreinteConstats approuvés
ContestationObjet, arguments, pièces, décision, statutConstat et éventuelle correction

DAT-05. Les identifiants sont stables ; les contenus publiés sont immuables. Les corrections créent des versions liées. Les exports utilisent des formats ouverts, notamment Markdown et JSON. Les schémas, valeurs autorisées et exemples valides et invalides doivent être livrés avec l’implémentation.

DAT-06. Une preuve porte deux relations distinctes : son accessibilité matérielle et sa pertinence pour l’assertion. Une URL valide ne prouve pas que son contenu justifie la conclusion. L’origine primaire est suivie pour éviter de compter plusieurs reprises comme plusieurs confirmations indépendantes.

Section § 06Méthode analytique#

6.1Contrat de chaque critère#

MET-01. Chaque critère possède un identifiant, une version, une question précise, une unité d’application, des conditions d’éligibilité, des éléments attendus, des sorties autorisées, des exemples, des contre-exemples, une règle d’abstention et une règle de revue.

MET-02. Les critères ne doivent pas obliger le système à conclure. Les termes comme « irréaliste », « populiste », « mensonger » ou « incohérent » ne sont pas des étiquettes libres. Toute qualification publiée doit être définie et étayée ; l’intention de tromper n’est pas inférée d’une erreur factuelle.

MET-03. L’annexe Grille analytique définit la première version applicable. Aucun agent n’ajoute de dimension ou de pondération au cours d’une analyse. Un besoin nouveau devient une proposition d’évolution de méthode.

6.2Style et précision des formulations#

STY-01. Le système décrit la précision des engagements, les ambiguïtés qui modifient leur interprétation, les termes non définis, les procédés argumentatifs observables et les indices de lisibilité. Les exemples sont cités avec leur contexte.

STY-02. Un vocabulaire technique, une émotion exprimée, une métaphore ou une répétition ne sont pas en eux-mêmes des défauts. La qualité littéraire et la désirabilité d’une politique ne sont pas notées. Les indices de lisibilité sont accompagnés de leur formule et de leurs limites en français.

STY-03. Les rubriques distinguent la description rhétorique et la spécification opérationnelle. Une mesure peut être précise sans être souhaitable, et claire sans être chiffrée. Une promesse vague peut être décrite comme telle sans devenir factuellement fausse.

6.3Cohérence interne#

COH-01. L’analyse recherche les compatibilités, contradictions explicites, tensions conditionnelles et dépendances non documentées. Elle vérifie au préalable l’identité du périmètre, de la période, des bénéficiaires, des définitions et des conditions.

COH-02. Une contradiction exige au moins deux passages incompatibles sous les mêmes conditions, une explication du conflit et la recherche d’une clause susceptible de le résoudre. Une mesure conditionnelle et une mesure générale ne sont pas déclarées contradictoires sans examen de leur articulation.

COH-03. Les liens peuvent traverser les chapitres : dépenses et recettes, moyens humains, délais, compétences, objectifs concurrents ou réutilisation d’une même ressource. Les calculs arithmétiques sont effectués par un outil déterministe avec unités, formules et hypothèses conservées.

COH-04. Une somme ne mélange pas stocks et flux, montant annuel et cumul pluriannuel, euros courants et constants, financement brut et net. Un double comptage n’est retenu qu’après contrôle des recouvrements et des conventions.

COH-05. La recherche de liens n’est pas limitée aux passages voisins. Elle combine un index global des engagements, des rapprochements thématiques et un registre transversal des ressources, échéances et contraintes. Sa capacité à retrouver les conflits éloignés doit être évaluée séparément de sa capacité à juger une paire fournie.

COH-06. « Aucune contradiction détectée » ne devient pas « programme cohérent ». Le résultat indique les domaines, types de liens et volumes examinés. Une contrainte extérieure au programme est rattachée à l’analyse contextuelle, sans être présentée comme contradiction interne.

6.4Vérification factuelle#

FAC-01. Seules les assertions factuellement vérifiables reçoivent un verdict factuel. Les projections sont analysées sous l’angle de leurs hypothèses et de leur documentation. Les valeurs restent descriptives. Les assertions composites sont divisées avant vérification.

FAC-02. Le dossier formule exactement la question vérifiée : objet, territoire, population, période, indicateur, unité, comparateur et date de référence. Une comparaison de taux indique le dénominateur et la définition statistique retenus.

FAC-03. Le système recherche des éléments favorables et défavorables. Il privilégie les données primaires adaptées : sources statistiques, textes officiels dans leur version pertinente, publications scientifiques ou documents budgétaires. Leur statut institutionnel ne dispense pas de vérifier méthode, périmètre et révisions.

FAC-04. Une conclusion centrale recherche une corroboration indépendante lorsque celle-ci est pertinente et disponible. Une source unique peut suffire pour une donnée dont elle est l’émetteur de référence, à condition de justifier ce choix et de vérifier son interprétation. Plusieurs articles reprenant le même chiffre ne constituent pas plusieurs origines.

FAC-05. Les preuves contradictoires ne sont pas départagées par comptage de sources. Le système compare leurs définitions, méthodes, dates et limites. Si le désaccord substantiel subsiste, il publie un résultat indéterminé et l’objet du désaccord.

FAC-06. Les verdicts sont : étayée, contredite, exacte mais contexte matériel manquant, indéterminée. Le statut « hors vérification factuelle » est distinct et réservé aux assertions non éligibles. La troisième catégorie exige de montrer comment l’omission change l’interprétation ; elle ne sanctionne pas toute simplification.

FAC-07. Une recherche infructueuse conduit à « indéterminée », jamais à « contredite ». Le nombre de recherches, les familles de sources consultées et le motif d’arrêt sont conservés.

FAC-08. Le système distingue l’état des connaissances à la date de l’affirmation et l’état des données à la date de vérification. Une révision statistique postérieure est signalée sans attribuer automatiquement une erreur à l’auteur du programme. Un contrôle historique utilise des sources disponibles à l’époque ou indique explicitement la limite.

La séparation entre détection des assertions, collecte des preuves et vérification est documentée dans la recherche sur le fact-checking automatisé. Les règles détaillées ci-dessus constituent des choix proposés pour ce projet. Synthèse scientifique (nouvel onglet)

6.5Conditions de réalisation#

REA-01. Le système relève les moyens annoncés, étapes, acteurs, délais et hypothèses. Il distingue une dépendance explicitée, une dépendance externe documentée et une hypothèse ajoutée par l’analyste.

REA-02. Une modification législative, constitutionnelle ou européenne annoncée est une étape à analyser. L’état actuel du droit n’autorise pas à conclure que toute proposition de le modifier est impossible. Les interprétations juridiques substantielles et les simulations économiques requièrent une expertise humaine adaptée.

REA-03. Le pilote peut constater un manque de documentation, une difficulté arithmétique ou une dépendance. Il ne produit pas de probabilité de réalisation ni de chiffrage original présenté comme une estimation institutionnelle.

Section § 07Couverture et sélection des vérifications#

COV-01. Toutes les pages et toutes les assertions identifiées entrent dans l’inventaire. Chaque assertion reçoit une destination : analyse effectuée, hors périmètre, non éligible, en attente ou impossible à traiter avec motif. L’inventaire automatique est lui-même contrôlé pour mesurer ses omissions.

COV-02. La vérification approfondie peut être sélective. Avant les résultats, une règle publique combine importance pour un engagement central, portée de l’assertion, caractère quantitatif et enjeu de décision. Elle ne dépend pas de la probabilité estimée de trouver une erreur ni de l’identité du candidat.

COV-03. Dans le pilote, les cas retenus comprennent les affirmations factuelles qui soutiennent directement les mesures étudiées et un échantillon aléatoire stratifié des autres assertions éligibles. Les strates, quotas, tirages et exclusions sont conservés. Le tirage aléatoire sert à détecter le biais de sélection ; il ne rend pas l’ensemble des vérifications représentatif par magie.

COV-04. Chaque dossier publie séparément les nombres d’assertions inventoriées, éligibles, sélectionnées, vérifiées, indéterminées et non vérifiées. Il indique le nombre de pages non extractibles et la couverture des annexes. Les pourcentages présentent numérateur et dénominateur.

COV-05. Un taux d’erreurs dans les assertions sélectionnées n’est pas extrapolé au programme entier. Les différences de longueur ou de précision des programmes sont présentées. Un programme succinct ne bénéficie pas implicitement d’un meilleur résultat parce qu’il contient moins de faits vérifiables.

COV-06. La sélection des constats mis en avant dans la synthèse suit une règle versionnée d’importance et de solidité. Elle est revue par un humain. Le nombre de constats défavorables n’est jamais ajusté pour équilibrer artificiellement les candidats.

Section § 08Organisation des agents et des contrôles#

8.1Répartition des responsabilités#

Les rôles sont des contrats de travail distincts ; ils n’exigent pas nécessairement un modèle différent chacun. Ils sont exécutés par des sessions externes utilisant la CLI et les skills distribués par Aune. Le choix des modèles dépendra de l’évaluation, des coûts et des environnements d’exécution retenus par les contributeurs.

RôleTravail confiéSortie attendueLimite
IngestionExtraire, localiser et contrôler les documentsTranscription et anomaliesNe réécrit pas les engagements
StructurationSegmenter, typer et relier les mesuresInventaire et fichesN’invente aucun champ absent
StyleAppliquer les rubriques descriptivesObservations sourcéesN’évalue pas la valeur politique
CohérenceExplorer les liens et contrôler les hypothèsesRelations et conflits candidatsNe tranche pas sur le seul sens commun
RechercheRecueillir les preuves et leur provenanceDossier de preuvesNe transforme pas un résultat de recherche en verdict
VérificationExaminer les preuves et appliquer les catégoriesConclusion motivéeS’abstient si le dossier est insuffisant
ContradictionChercher une réfutation du constat ou une exceptionObjections explicitesNe force pas le désaccord
RestitutionRédiger à partir des constats autorisésSynthèse traçableN’ajoute aucun nouveau fait
Contrôles déterministesVérifier schémas, liens, calculs, versions et droitsRapport de conformitéNe jugent pas le sens politique

8.2Exécution et indépendance#

SchémaChaîne d’exécution
    • Documents admis et versions figées
    • Transcription et contrôle de fidélité
    • Assertions et mesures reliées aux passages
  1. Analyses indépendantes

    • Style et précision
    • Cohérence et dépendances
    • Recherche et vérification des faits
    • Contre-examen des constats
    • Revue humaine et traitement des désaccords
    Retour possible vers une recherche complémentaire ou un résultat indéterminé, puis nouvelle revue humaine.
    • Synthèse fondée sur les constats approuvés
    • Validation éditoriale et publication
    • Contestations et nouvelles versions
Source du schéma (Mermaid)
flowchart TD
    A[Documents admis et versions figées] --> B[Transcription et contrôle de fidélité]
    B --> C[Assertions et mesures reliées aux passages]
    C --> D[Style et précision]
    C --> E[Cohérence et dépendances]
    C --> F[Recherche et vérification des faits]
    D --> G[Contre examen des constats]
    E --> G
    F --> G
    G --> H[Revue humaine et traitement des désaccords]
    H --> I[Synthèse fondée sur les constats approuvés]
    I --> J[Validation éditoriale et publication]
    H --> K[Recherche complémentaire ou résultat indéterminé]
    K --> H
    J --> L[Contestations et nouvelles versions]

Les retours pour recherche complémentaire sont bornés. À leur limite, une question non résolue conserve son statut indéterminé et ne fait pas obstacle à la publication des autres résultats validés.

AGT-01. Le travail suit une procédure explicite : admission, ingestion, contrôle documentaire, structuration, analyses indépendantes, contradiction, arbitrage humain, restitution, approbation puis publication. Aune contrôle les prérequis, droits et transitions du registre de tâches ; les sessions externes exécutent les rôles IA à travers la CLI. Aucun processus d’agent n’est lancé ou hébergé par Aune. Les agents ne disposent pas d’un droit autonome de publication.

AGT-02. Les premières évaluations indépendantes ne consultent pas les conclusions des autres évaluateurs. Après cette phase, les objections et révisions sont tracées. Un agent ne peut pas supprimer un désaccord pour rendre le rapport plus uniforme.

AGT-03. Chaque résultat conserve le modèle exact lorsqu’il est disponible, le fournisseur, la configuration, la version des instructions, les entrées, outils, preuves, sorties et incidents. Les données observées par Aune sont distinguées des déclarations de la session externe et des données inconnues. L’outil et le skill déclarés ne constituent pas une attestation de leur exécution effective. Le système conserve des justifications éditoriales vérifiables ; il ne dépend pas de l’accès au raisonnement interne privé du modèle.

AGT-04. La première configuration limite la confrontation à deux cycles. Une objection non résolue déclenche une revue ou une abstention. Les budgets de recherches, appels, durée et coût sont fixés avant chaque campagne. Aune impose les limites sur les opérations qu’il contrôle ; les budgets d’inférence externes relèvent de l’opérateur et de l’instrumentation d’évaluation. Une limite atteinte est déclarée et produit un statut visible, sans conclusion de remplacement. Une consommation non observable reste inconnue.

AGT-05. Le pilote compare une procédure simple à un agent outillé et une procédure à rôles multiples, à budget comparable. Les performances avant et après revue humaine sont distinguées. Le surcoût des agents doit améliorer au moins un résultat préenregistré, sans dégrader les exigences critiques.

Des travaux comparatifs montrent que les gains attribués au débat multi-agent peuvent provenir largement de l’agrégation des réponses. Le choix d’une architecture complexe doit donc être éprouvé sur notre tâche. Étude comparative sur le débat multi-agent (nouvel onglet)

8.3Traitement des contenus non fiables#

SEC-01. Les programmes, pages Web et réponses de tiers sont des données non fiables. Une instruction contenue dans un PDF ou une page ne peut modifier ni la méthode, ni les outils autorisés, ni le circuit de publication.

SEC-02. Les outils de collecte ont des accès limités : aucune commande fournie par un document n’est exécutée ; les URL internes et les ressources privées sont protégées contre les requêtes détournées ; les fichiers sont contrôlés et les extractions isolées.

SEC-03. L’interface neutralise le contenu actif des fichiers et du Markdown. Les secrets, identifiants et données personnelles des déposants ne sont pas insérés dans les contextes des agents ni dans les exports publics. Les opérations éditoriales sensibles disposent d’un contrôle d’accès et d’un journal d’audit.

Section § 09Revue humaine et publication#

9.1Niveaux de résultat#

PUB-01. Un constat possède trois informations séparées : sa conclusion analytique, son état de traitement et son état éditorial. Exemple : « contredite », « vérification terminée », « revue en cours ». Un échec technique ne devient jamais un verdict analytique.

PUB-02. Les états éditoriaux sont brouillon, en revue, approuvé, publié, contesté, corrigé, retiré et remplacé. Une contestation ne retire pas automatiquement un constat ; son traitement dépend des éléments nouveaux. Une correction substantielle invalide l’approbation précédente et exige une nouvelle revue.

PUB-03. Dans le pilote, chaque constat interprétatif ou factuel publié est revu par une personne autre que son rédacteur humain éventuel. Les qualifications « contredite », « contexte matériel manquant » et « contradiction explicite » exigent en plus une seconde validation éditoriale indépendante. Les avis spécialisés sont requis lorsque la conclusion dépend d’une expertise non présente dans l’équipe.

PUB-04. Les métadonnées techniques peuvent être contrôlées automatiquement. Leur publication reste incluse dans l’approbation du dossier. La synthèse reçoit une revue propre, car un assemblage de constats exacts peut produire une présentation déséquilibrée ou trop affirmative.

9.2Contenu obligatoire d’un constat#

Un constat public comporte : question étudiée, citation exacte, contexte nécessaire, édition du corpus, critère appliqué, conclusion, éléments favorables et défavorables pertinents, calcul éventuel, justification concise, limites, date de référence, état de revue et lien de contestation.

PUB-05. Le degré de solidité est décrit par des éléments observables : preuve directe ou indirecte, périmètre concordant ou incomplet, objection résolue ou persistante. Un pourcentage de confiance autoattribué par un modèle n’est pas présenté comme une probabilité de vérité.

PUB-06. Chaque assertion factuelle de la synthèse renvoie à un constat approuvé. Chaque nouvelle donnée introduite pendant la rédaction repasse dans le circuit de vérification. Les documents exportés mentionnent leur édition et un lien vers les corrections ultérieures.

9.3Réponse des auteurs et correction#

PUB-07. Une procédure commune permet aux auteurs de transmettre preuves et observations avant publication d’une critique substantielle. Délai proposé pour le pilote : trois jours ouvrés à compter d’une notification reçue, avec adaptation documentée si nécessaire. L’absence de réponse est décrite sans devenir une preuve défavorable. La participation ne confère aucun veto.

PUB-08. Une réponse distingue correction du corpus, preuve nouvelle, nouvelle position politique et désaccord d’interprétation. Elle est rattachée à la version correspondante. Les coordonnées personnelles des interlocuteurs restent privées.

PUB-09. Objectifs de traitement proposés : accusé de réception sous deux jours ouvrés ; qualification d’une erreur potentiellement grave sous un jour ouvré ; décision ou point motivé sous dix jours ouvrés. La disponibilité effective de l’équipe est affichée. Ces objectifs ne sont pas présentés comme des délais légaux.

PUB-10. Une erreur grave crédible entraîne un examen prioritaire et, si nécessaire, une suspension conservatoire du constat. Toute correction matérielle affiche ce qui a changé, pourquoi, quand et quels exports ou comparaisons sont affectés. Les anciennes versions restent consultables sauf motif documenté de protection de données ou de droits.

Les référentiels professionnels insistent sur l’explicitation des méthodes, la qualité des sources, la revue et les corrections. Ils constituent des points de comparaison pour notre procédure ; le projet ne revendique aucune certification. EFCSN (nouvel onglet) et IFCN (nouvel onglet).

Section § 10Gouvernance de la méthode#

10.1Responsabilités#

GOV-01. Le projet désigne un responsable éditorial, un responsable méthodologique, un responsable technique et un responsable de l’évaluation. Les personnes qui optimisent les agents ne doivent pas être seules à décider de leur réussite au test final. Les cumuls de fonctions et les mesures compensatoires sont publics.

GOV-02. Un comité méthodologique pluraliste est constitué pour la version publique. Proposition initiale : cinq à sept membres couvrant sciences politiques, statistique, vérification de faits, politiques publiques et systèmes IA. Le pluralisme concerne les compétences et les sensibilités ; les partis peuvent contribuer et contester sans contrôler les décisions.

GOV-03. Les financements, liens d’intérêt et règles de récusation sont publics. Une personne directement impliquée dans une campagne ne valide pas les analyses de cette campagne ou de ses concurrents. Aucun financeur ne peut imposer un verdict, un classement ou une exemption de contrôle.

10.2Amendements par consensus documenté#

GOV-04. Une modification suit les étapes suivantes : proposition publique, motif, exemples affectés, consultation, expérimentation sur un corpus de développement, examen des effets, décision et publication d’une version. Le jeu de test réservé à la réception finale ne sert pas à optimiser la proposition.

GOV-05. Le consensus signifie l’absence d’objection motivée non résolue parmi les membres habilités participant à la décision, avec un quorum proposé de deux tiers des membres non récusés et au moins trois personnes. Une simple absence de réponse ne vaut pas assentiment. Les avis et récusations sont consignés.

GOV-06. Si le consensus échoue, la règle en vigueur reste applicable. Une variante peut être expérimentée sous un nom distinct, avec ses limites ; elle n’est pas introduite discrètement dans les publications. Une ambiguïté qui compromet la sûreté d’un critère entraîne sa suspension conservatoire.

GOV-07. Une correction factuelle n’attend pas un consensus sur la méthode. Elle relève de la procédure éditoriale. Inversement, un consensus méthodologique ne transforme pas un fait contesté en fait établi.

10.3Versions et ouverture#

GOV-08. La méthode, les critères, instructions d’agents, schémas, règles de sélection et évaluations utilisent des versions reliées dans un manifeste de publication. Un changement de sens d’un critère impose une nouvelle version majeure ; un ajout compatible une version mineure ; une clarification sans changement de sens une correction de version.

GOV-09. Une modification de modèle, de moteur de recherche ou d’extraction déclenche les tests de non-régression adaptés, même si la grille ne change pas. Une dérive non maîtrisée suspend la production des verdicts concernés.

GOV-10. Le code et les outils nécessaires à la reproduction sont publiés sous une licence open source explicite ; les documents méthodologiques sous une licence ouverte adaptée. Les licences définitives sont arrêtées avant la première diffusion publique. Les licences des modèles et des corpus sont distinguées de celles du projet.

GOV-11. Le secret temporaire d’un jeu de test protège la mesure. Son empreinte et son protocole sont enregistrés avant essai ; les éléments redistribuables sont publiés après qualification puis remplacés pour l’évaluation suivante. Les modèles propriétaires éventuels sont identifiés avec leurs limites de reproductibilité.

Section § 11Reproductibilité et architecture fonctionnelle#

11.1Reproduction d’un dossier#

REP-01. Une publication possède un paquet de preuve : inventaire et empreintes des entrées, copies autorisées, transcriptions, unités structurées, critères, preuves, calculs, exécutions, décisions humaines et sortie publiée. Les dépendances non redistribuables sont décrites avec une procédure d’accès lorsque possible.

REP-02. Le projet distingue trois niveaux : recalcul exact des opérations déterministes, audit des entrées et sorties archivées, et nouvelle exécution des modèles. Le troisième niveau peut varier ; une réponse identique caractère par caractère n’est pas promise pour les services de modèles externes.

REP-03. L’indisponibilité d’un modèle ou d’une source ne doit pas détruire l’audit du dossier historique. Une nouvelle exécution ne remplace jamais l’ancienne sans créer une édition distincte.

11.2Composants attendus#

Le système comprend un registre documentaire, un stockage des originaux et preuves, une base d’objets structurés, un moteur de recherche, un registre de tâches, une API, une CLI et des skills distribués, une interface de revue et un site public. La plateforme contrôle les données et le déroulement éditorial sans héberger les agents. Le socle CLI envisagé est served-tool, selon le document d’architecture. L’architecture doit permettre de remplacer un modèle externe sans réécrire les données historiques.

ARC-01. Les échanges sont asynchrones et les travaux reprenables depuis leur dernier dépôt. Les mutations serveur sont idempotentes : rejouer une opération ne crée pas de doublon ni de seconde publication. La CLI conserve les modifications locales non déposées. Une étape incomplète n’est pas marquée réussie. Les erreurs de réseau sont distinguées de l’absence d’information. L’état « en cours » ne garantit pas qu’une session externe soit encore active.

ARC-02. Les entrées, critères et versions déterminent les éléments réutilisables en cache. Une nouvelle preuve ou un changement de programme invalide les conclusions dépendantes. Les liens de dépendance permettent de calculer les révisions nécessaires.

ARC-03. La publication constitue une opération explicite sur une édition approuvée. Le site lit uniquement les éditions publiées. Les brouillons et corpus réservés ne sont pas accessibles via les liens publics, moteurs de recherche ou exports.

ARC-04. Une interface de revue affiche côte à côte le passage original, la transcription, le constat, ses preuves, les objections et l’historique. Le relecteur peut approuver, corriger, demander une recherche ou rejeter avec motif. Une approbation porte sur une version exacte.

ARC-05. Le site public permet de consulter par programme et par thème, de filtrer les types de constats, d’ouvrir les sources, de lire la méthode, de comparer des éditions et de déposer une contestation. Les statuts ne reposent pas seulement sur la couleur. Les fonctions essentielles sont accessibles au clavier et sur mobile. Ces parcours publics relèvent de P1 ; leur équivalent documentaire suffit au pilote fermé.

ARC-06. Les contenus publiés sont préproduits ; leur simple consultation ne relance pas une analyse générative. La première version n’inclut pas de conversation libre susceptible de produire des verdicts non revus.

Section § 12Exploitation et protection des données#

OPS-01. Le tableau d’exploitation suit les files d’attente, échecs, coûts par étape, minutes de revue, volume non traité, taux d’abstention, disponibilité des sources et corrections. Les alertes portent sur les incidents et dérives ; le taux de constats défavorables n’est pas un objectif de production.

OPS-02. Un budget de campagne et des plafonds par tâche sont fixés avant le lancement. Un dépassement arrête ou reporte les étapes concernées, sans diminuer silencieusement leur qualité. Le coût total comprend extraction, recherches, modèles, stockage, expertise et revue. Aune mesure et borne les services qu’il contrôle ; les coûts des sessions externes sont déclarés, instrumentés lorsqu’ils sont mesurables, ou explicitement inconnus. Aucune limite serveur n’est présentée comme un plafonnement de la facturation d’un fournisseur utilisé directement par un contributeur.

OPS-03. Les données de contact des déposants et contestataires sont séparées des corpus publics. Leur accès, finalité et durée de conservation sont documentés. Les données personnelles inutiles présentes dans les documents sont masquées dans les vues publiques. Les contrats des fournisseurs et l’usage éventuel des données pour l’entraînement sont examinés avant traitement externe.

OPS-04. Les sauvegardes couvrent documents, versions, preuves et décisions. Une restauration complète d’un dossier est testée avant ouverture publique. Les suppressions nécessaires pour des raisons de droits sont tracées sans conserver indûment les données à supprimer.

OPS-05. Avant ouverture publique, une revue juridique qualifie les obligations applicables au service, notamment publication, données personnelles, droits sur les documents et usage de l’IA. Le cahier des charges ne préjuge pas d’une qualification réglementaire. Aucun certificat de conformité n’est implicite.

Section § 13Pilote de démonstration#

13.1Périmètre proposé#

PIL-01. Le pilote travaille sur six programmes officiels historiques francophones, choisis par une procédure documentée. Les élections de référence et les documents exacts sont fixés lors du gel du corpus. Il ne suppose ni une liste complète des candidats de 2027 ni la disponibilité de leurs programmes définitifs.

PIL-02. Tous les documents sont ingérés intégralement. Trois domaines font l’objet de l’analyse approfondie initiale : finances publiques, services publics et énergie ou climat. Leurs sous-thèmes sont précisément définis avant sélection des assertions. Les dépendances situées ailleurs dans les programmes restent consultables, mais la couverture analytique limitée est affichée.

PIL-03. Au moins 600 unités réelles sont annotées par deux personnes indépendamment : 300 pour le développement, 300 réservées au test. La séparation s’effectue par programme et par groupe de passages ou propositions équivalentes ; une paraphrase d’un cas de développement ne peut devenir un test prétendument nouveau. Un programme complet, avec toutes ses annexes et versions équivalentes, appartient à un seul ensemble.

PIL-04. Des jeux spécialisés complètent ce corpus pour les faits, liens de cohérence, erreurs d’extraction et attaques documentaires. Les cas naturels et les cas construits sont rapportés séparément. Les détails de taille, sélection et notation figurent dans le protocole de validation.

13.2Résultats exigés#

Le pilote livre au moins trois dossiers couvrant des programmes distincts, selon la même méthode et le même périmètre, un rapport complet de couverture des six programmes, un rapport d’évaluation, un journal des désaccords humains et un relevé des coûts et temps. Les six programmes ne sont pas tous nécessairement publiés pendant le pilote ; la règle de choix des trois dossiers est fixée avant leurs résultats.

Les dossiers non publiables sont documentés avec la cause précise. Une démonstration convaincante doit montrer aussi un cas d’abstention, une objection qui a modifié une analyse, une correction de transcription et une mise à jour de dossier.

13.3Seuils de réception proposés#

Les objectifs suivants sont des choix de réception du projet. Ils seront gelés avant le test final. Leur interprétation, les dénominateurs et les intervalles d’incertitude sont définis dans l’annexe ; aucun seuil ne peut être présenté comme atteint sans mesure.

MesureCible proposéeNature
Ancrages et versions des constats publiés100 % complets et ouvrables dans le dossierBlocage de publication
Citations ou sources inventées dans les dossiers finaux0 cas observéBlocage de publication
Revue humaine des constats publiés100 % selon le circuit prévuBlocage de publication
Fidélité des champs sensibles extraitsAu moins 99 % sur échantillon réservéQualification technique
Rappel de l’extraction des unitésAu moins 95 % sur jeu réservéQualification analytique
Classification des types d’assertionsMacro F1 au moins 0,90Qualification analytique
Verdicts factuels conclusifs correctsPrécision au moins 95 %, avec contrôle par classeQualification analytique
Contradictions explicites correctement qualifiéesPrécision au moins 95 % sur les cas signalésQualification analytique
Récupération des conflits connus à distanceRappel au moins 85 % sur le jeu définiQualification de la recherche
Conclusions matérielles stables entre réexécutionsAu moins 95 % sur trois exécutionsQualification de stabilité
Perturbations d’identité sans effet légitimeAu plus 5 % de changements matérielsQualification du masquage

Les taux ci-dessus ne suffisent pas isolément. Une précision élevée obtenue en s’abstenant presque toujours n’est pas acceptable : couverture, rappels, effectifs par classe et intervalles sont présentés. Une famille de verdicts insuffisamment testée reste non qualifiée et ne peut pas être annoncée fiable.

13.4Décision à la sortie du pilote#

PIL-05. Trois décisions sont possibles : ouverture du périmètre qualifié ; poursuite du pilote avec corrections ciblées ; abandon d’un rôle automatisé au profit d’une procédure plus simple ou humaine. Une bonne présentation ne compense pas un défaut de traçabilité ou une précision insuffisante.

PIL-06. Un dossier peut être publié comme travail humain assisté si sa revue intégrale satisfait les exigences éditoriales alors qu’un module automatique reste non qualifié. Cette exception est affichée et n’autorise ni revendication de fiabilité automatique ni augmentation de cadence fondée sur ce module.

Section § 14Organisation et charge du premier chantier#

14.1Jalons proposés#

JalonTravail principalLivrable de sortieCondition de passage
J0Désigner les responsables et fixer le corpusCharte, périmètre, droits, protocole geléResponsabilités et règles explicites
J1Construire le référentiel humainGuide annoté, exemples, arbitragesCritères suffisamment interprétables
J2Réaliser la chaîne documentaireOriginaux, Markdown, unités, ancragesContrôles de fidélité satisfaits
J3Implémenter les contrats API, CLI et skills puis comparer les procédures externesAller-retour de tâches, exécutions comparables et tracesSorties valides, versions figées et sécurité testées
J4Conduire le test réservé et la revueRapport de mesures et dossiers corrigésRésultats examinés sans adaptation opportuniste
J5Produire les dossiers de démonstrationÉditions approuvées et exportsToutes les exigences de publication satisfaites
J6Ouvrir le périmètre qualifiéSite, correction, exploitationRecette publique et responsabilités actives

Hypothèse de planification : six à huit semaines pour J0 à J5 avec une personne dédiée au développement, une à la méthode et à l’évaluation, deux annotateurs à temps partiel et un responsable éditorial disponible. Cette durée est une hypothèse de travail, pas un engagement ; elle doit être réestimée après J1 à partir des temps observés. J6 dépend aussi de la disponibilité éditoriale et du périmètre réellement qualifié.

14.2Modèle de coût#

Le budget est calculé à partir des volumes observés : pages à transcrire, unités à annoter, dossiers de preuves à rechercher, cas à arbitrer, nombre d’appels et coût des modèles, temps de revue et hébergement. Les essais comparatifs incluent le temps humain de correction ; un modèle moins cher qui augmente fortement ce temps n’est pas nécessairement préférable.

Aucun montant financier fiable ne peut être fixé sans corpus ni tarifs fournisseurs choisis. J1 doit fournir une estimation basse, centrale et haute sur la base d’un lot chronométré, ainsi qu’un plafond autorisé pour J2 à J5. Le projet ne doit pas s’engager sur une analyse exhaustive de toutes les candidatures avant cette estimation.

Section § 15Livrables et responsabilité de réception#

LivrableContenu requisResponsable de réception
Méthode versionnéeCritères, exemples, limites, gouvernanceResponsable méthodologique
Corpus documentéOrigines, droits, versions, transcription, ancragesResponsable éditorial
Données structuréesSchémas, dictionnaire, exports et liensResponsables technique et méthode
Interface exécutableAPI, CLI, skills, contrats de tâche, versions, plafonds contrôlables et repriseResponsable technique
Référentiel humainAnnotations indépendantes, désaccords, arbitragesResponsable de l’évaluation
Rapport de qualificationMesures par tâche, effectifs, coûts, biais, limitesÉvaluateur distinct des optimisateurs
Dossiers de démonstrationConstats, preuves, réponse, correctionsResponsable éditorial
Dossier de reproductionEntrées autorisées, versions, calculs, tracesResponsable de l’évaluation
Procédure de recoursFormulaire, statuts, délais, décisionsResponsable éditorial
Interface publique P1Consultation, méthode, historique, accessibilitéResponsable produit

La réception porte sur les preuves de conformité et sur les cas de recette, pas sur une démonstration choisie après coup. Les écarts ouverts mentionnent leur importance, leur effet sur le périmètre publiable, leur responsable et leur échéance. Aucun écart critique n’est accepté silencieusement.

Section § 16Risques qui doivent rester visibles#

RisqueSignal observableRéponse requise
Biais politique résiduelVerdict variant avec une étiquette sans changement de fondTest apparié, revue, restriction du critère
Erreurs corrélées entre agentsMême conclusion reposant sur une source ou lecture erronéeAnalyse indépendante et contrôle des preuves
Avantage aux programmes vaguesPeu de constats parce que peu de faits vérifiablesCouverture, précision documentaire et absences affichées séparément
Faux conflit entre chapitresExceptions ou périodes ignoréesContrôle des conditions et recherche globale
Erreur documentaire propagéeChiffre ou négation mal transcritsAncrage à l’original et invalidation des résultats dépendants
Sélection des cas favorisant une conclusionThèmes ou assertions retenus après lecture des verdictsRègle et tirage préenregistrés
Capture de la gouvernanceIntérêts non déclarés, veto partisan ou financierTransparence, récusation et procédure publique
Dérive d’un fournisseurRésultats différents à configuration apparente identiqueRéévaluation, archivage et suspension ciblée
Reprise médiatique excessiveUn constat devient une note globale du candidatFormulations précises et contexte intégré aux exports
Goulot de revue humaineAccumulation de brouillons et délais non tenusRéduction du périmètre et publication de la file d’attente agrégée

Section § 17Décisions à acter lors du lancement#

Le document fournit une proposition complète pour travailler sans attendre un consensus sur chaque détail technique. Avant d’exécuter le pilote, le porteur du projet et les responsables désignés doivent toutefois acter les six programmes, les sous-thèmes, le protocole de sélection, les licences, le budget maximal et les personnes responsables de la publication et de l’évaluation.

Les choix de modèles et de technologies seront décidés à partir des essais. La première preuve de réussite sera un petit nombre de dossiers dont chaque conclusion résiste à une lecture contradictoire, dont les limites sont visibles et dont les corrections peuvent être suivies.

Section § 18Références et portée#

Sources consultées le 24 septembre 2026. Elles éclairent le projet ; les seuils, rôles, identifiants et procédures de ce cahier des charges sont des propositions de conception originales à valider sur le pilote.

Télécharger le Markdown
Version
0.2.0
Date
24 septembre 2026
Fichier
cahier-des-charges-analyse-programmes.md

Proposition publiée pour examen, non gelée. Ce document ne contient aucun résultat d’analyse validé.