Codex chiffre les prompts des sous-agents, réponse à un ticket GitHub

5 min de lecture

Codex chiffre les prompts des sous-agents, réponse à un ticket GitHub · OpenAI publie un guide pour mesurer le « useful work per dollar » des agents · U...

🎧 Écouter cet article

Version audio générée automatiquement — texte nettoyé pour une écoute fluide

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • Codex chiffre les prompts des sous-agents, réponse à un ticket GitHub [1]
  • OpenAI publie un guide pour mesurer le « useful work per dollar » des agents [2]
  • Un paper montre que les agents LLM multi-agents n’explorent pas entre eux [16]

Les 3 signaux

🔒 Codex chiffre les prompts des sous-agents

Codex chiffre les prompts des sous-agents OpenAI a fermé le ticket GitHub #28058 sur Codex : les prompts des sous-agents sont désormais chiffrés [1]. La discussion (248 commentaires) indique une préoccupation de sécurité opérationnelle pour les workflows multi-agents. Aucun détail technique sur l’algorithme de chiffrement ou le périmètre exact n’est fourni. Pourquoi ça compte : si vous déployez des agents qui délèguent à des sous-agents, le chiffrement côté OpenAI empêche l’inspection des prompts intermédiaires — impact direct sur le debugging et l’auditabilité.

💰 OpenAI formalise le ROI des agents

OpenAI formalise le ROI des agents OpenAI publie un guide « Managing AI investments in the agentic era » qui définit une métrique : « useful work per dollar » [2]. Le document explique comment mesurer l’efficacité des workflows agentiques, améliorer l’efficience et scaler les tâches à haute valeur. C’est un cadre de pilotage, pas un benchmark technique. Pourquoi ça compte : si vous devez justifier un budget agent auprès de votre direction, cette métrique propriétaire devient le standard de facto — préparez-vous à aligner vos dashboards.

🤖 Les agents multi-agents n’explorent pas entre eux

Les agents multi-agents n'explorent pas entre eux Le paper « Multi-Agent LLMs Fail to Explore Each Other » (arXiv) démontre que les agents LLM modernes adoptent des patterns d’interaction myopes et polarisés, menant à des décisions sous-optimales [16]. L’exploration mutuelle, pourtant essentielle à l’autonomie, est absente. Pourquoi ça compte : si vous concevez des systèmes multi-agents, vous devez compenser ce biais d’exploration par des heuristiques externes — ne comptez pas sur les LLMs seuls pour coordonner.

À retenir

  1. Chiffrement des prompts sous-agents — Codex crypte les prompts intermédiaires, impactant le debugging des workflows multi-agents [1]
  2. « useful work per dollar » — Nouvelle métrique OpenAI pour justifier les investissements agentiques [2]
  3. Absence d’exploration mutuelle — Les agents LLM multi-agents échouent à explorer entre eux, produisant des décisions sous-optimales [16]

🔍 Radar Contradictions

Claim : OpenAI affirme que les entreprises peuvent mesurer “useful work per dollar” pour gérer les investissements IA [2]. Contre-signal : L’article arXiv [5] montre que les agents LLM appliquent une stratégie “maximum-context-first” inefficace, transformant une édition simple en une tâche lourde, ce qui contredit la notion de travail utile mesurable. Ce que ça change pour un dev : La métrique “useful work per dollar” risque d’être faussée par l’inefficacité intrinsèque des agents, rendant son calcul peu fiable.

⏱ Reproduit en 15 min

Repo/Snippet : Clawk – Give coding agents a disposable Linux VM [4] Comment tester : git clone https://github.com/clawkwork/clawk.git, puis lancer docker compose up pour démarrer l’API, et exécuter un agent de codage en pointant sur http://localhost:8080. Prérequis : Docker, Python 3.10+

📊 Track Record

Ce qu’on disait le 2026-06-30 : Agents-A1, un modèle 35B MoE, atteint des performances de niveau trillion de paramètres en scalant l’horizon d’agent [15] Verdict aujourd’hui : en attente. Aucun élément du jour ne mentionne Agents-A1 ni ne confirme ou infirme ses performances. Le papier arXiv [5] montre que les agents LLM peinent encore à évaluer la complexité des tâches, ce qui relativise l’ampleur du scaling annoncé, sans le contredire directement.

🕳 Sous le radar

L’item : arXiv 2607.13034v1 – “Do AI Agents Know When a Task Is Simple?” [5] (faible: 0 citations) Pourquoi c’est du signal : Identifie un biais de surconsommation de contexte chez les agents LLM, qui exécutent des relectures inutiles pour une simple édition. Propose une piste de complexité-aware reasoning, directement exploitable pour optimiser les coûts d’inférence.

❓ Donnée manquante

L’annonce : OpenAI annonce ChatGPT Work pour data science et ventes [12][13]. Ce qui manque : Le coût d’inférence par tâche (ex. “root-cause brief”) n’est pas disclosed. Pourquoi ça compte : Sans coût par requête, impossible de calculer le “useful work per dollar” pour les équipes, pourtant présenté comme métrique clé dans leur propre guide d’investissement [2].


🔗 Sources (18) — vérifiées le 15/07/2026 11:15 UTC

  1. Codex starts encrypting sub-agent promptsHacker News · 2026-07-14
  2. How to manage AI investments in the agentic eraOpenAI · 2026-07-14
  3. Empowering India’s next generation of innovators with ATL SaathiGoogle DeepMind · 2026-07-13
  4. Show HN: Clawk – Give coding agents a disposable Linux VM, not your laptopHacker News · 2026-07-13
  5. Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and ExecutionarXiv · 2026-07-14
  6. DenseReward: Dense Reward Learning via Failure Synthesis for Robotic ManipulationarXiv · 2026-07-14
  7. TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at ScalearXiv · 2026-07-14
  8. PalmClaw: A Native On-Device Agent Framework for Mobile PhonesarXiv · 2026-07-14
  9. FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem GenerationarXiv · 2026-07-14
  10. ViHoRec: A Quality-Controlled Vietnamese Hotel Recommendation Dataset and Cold-Start BenchmarkarXiv · 2026-07-14
  11. Celebrating 25 years of visual search innovationGoogle AI · 2026-07-14
  12. How data science teams use ChatGPT WorkOpenAI · 2026-07-14
  13. How sales teams use ChatGPT WorkOpenAI · 2026-07-14
  14. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal ModelsHF Papers
  15. Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue ResolutionHF Papers
  16. Multi-Agent LLMs Fail to Explore Each OtherHF Papers
  17. Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation ModelHF Papers
  18. Motion4Motion: Motion Transfer Across Subjects at InferenceHF Papers

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 15/07/2026 à 11:15 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Pas de spam. Désabonnement en 1 clic.