Partager ce rapport :
TL;DR
- Anthropic sort Claude Fable 5.1, score 52,6% sur Terminal-Bench-Science 0.1 [3]
- datasette-mcp 0.2 passe en release stable,
rowsdevient un tableau d’objets [2] - Gemini 3.8 Flash disponible via llm-gemini 0.34, trois niveaux de thinking [10]
Les 3 signaux
🎨 Claude Fable 5.1 : focus science et code
Anthropic publie Fable 5.1 avec un argumentaire centré sur le coding, le knowledge work et les tâches longues. Le benchmark Terminal-Bench-Science 0.1 est nouveau, et le score annoncé est de 52,6% [3]. Les prompts système des applications consumer sont publiés, avec historique des modifications — mais pas pour Claude Cowork ni Claude Code [11]. Le nouveau prompt système insiste notamment sur le refus de reproduire des paroles de chansons [11].
Pourquoi ça compte : si vous évaluez des modèles pour de l’automatisation scientifique ou du code long-running, Fable 5.1 introduit un benchmark spécialisé que vous pouvez réutiliser pour comparer vos propres agents.
🗄️ datasette-mcp 0.2 : première release stable
Le plugin MCP pour Datasette sort sa première version non-alpha. Le changement majeur : rows dans execute_sql passe d’un tableau de tableaux à un tableau d’objets. Objectif assumé : éviter que les modèles faibles perdent le fil entre position et colonne [2]. Dépendance mise à jour vers mcp>=2.1.1 [2].
Pourquoi ça compte : si vous exposez des bases SQL à des LLM via MCP, ce changement de format élimine une classe entière d’erreurs de mapping colonne/valeur chez les petits modèles.
⚡ Gemini 3.8 Flash intègre llm-gemini 0.34
La mise à jour ajoute le modèle gemini-3.8-flash avec trois niveaux de thinking : low, medium, high [10]. Un fix corrige aussi l’enregistrement du modèle résolu pour les réponses async [10]. Google a également publié une variante “Cyber” réservée aux “trusted defenders” [10].
Pourquoi ça compte : vous pouvez maintenant choisir explicitement le niveau de reasoning pour Gemini 3.8 Flash, ce qui vous donne un levier direct sur le coût par requête selon la complexité de la tâche.
À retenir
- 52,6% — score de Claude Fable 5.1 sur Terminal-Bench-Science 0.1, benchmark scientifique inédit [3]
- 0.2 — datasette-mcp passe en stable,
rowsrenvoie des objets nommés au lieu de tableaux positionnels [2] - gemini-3.8-flash — nouveau modèle dans llm-gemini 0.34, avec thinking low/medium/high sélectionnable [10]
🛠 Tuto du jour
Tuto / Outil : Aucun tuto d’installation locale identifiable. Les éléments citent des releases de plugins (datasette-mcp [2], llm-gemini [10]) et des benchmarks, mais aucun guide, repo ou script d’installation pour Ollama, llama.cpp, LM Studio, vLLM ou Docker n’est fourni.
Aucun tuto d’installation locale identifié aujourd’hui.
💻 Matos & Infra local
Sujet Matos/Infra : Entraînement d’un petit transformer en 1,5 h [4] Constat technique : Un petit transformer entraîné en 1,5 heure surpasserait de nombreux LLMs, suggérant un ratio performance/temps de calcul élevé pour des configurations matérielles modestes. Recommandation dev : Évaluer ce type de modèle pour des tâches ciblées nécessitant une inférence locale à faible coût. Sujet Matos/Infra : Runtime applicatif lourd [14] Constat technique : L’application de bureau Codex embarque 1,7 Go de runtime, incluant des installations complètes de Python et Node.js. Recommandation dev : Anticiper l’empreinte disque et mémoire des applications intégrant des runtimes LLM locaux.
🎯 Fine-Tuning & Quantiz
Technique / Outil : Pipeline de spécialisation post-entraînement pour compétitions de programmation [9] Apport : Combine curation de problèmes à grande échelle, traces de raisonnement synthétiques et supervised fine-tuning [9]. Impact pratique : Pipeline de fine-tuning supervisé ciblant un domaine précis, la programmation compétitive [9]. Pas de nouveauté fine-tuning ou quantification aujourd’hui.
🧠 RAG & Agents Locaux
Architecture / Outil : ExecRetrieval [7] Cas d’usage : Évaluation de la correction fonctionnelle du code retrievé pour agents de codage et génération augmentée par récupération (RAG) [7] Clé de voûte : Benchmark avec variantes contrôlées vérifiées par exécution, mesurant l’écart entre similarité lexicale et exactitude fonctionnelle [7]
📊 Track Record
Ce qu’on disait le 2026-08-16 : Google sort Gemini 3.7 Flash, supporté par le plugin llm-gemini 0.33 [3][13] Verdict aujourd’hui : partiellement tenu. Le support est confirmé et étendu : llm-gemini 0.34 ajoute le nouveau modèle gemini-3.8-flash, avec niveaux de réflexion low, medium et high [10]. La lignée Gemini Flash continue, mais la version 3.7 est supplantée par la 3.8, sans preuve directe de la pérennité de la 3.7.
🔗 Sources (18) — vérifiées le 03/09/2026 05:00 UTC
- GeoJSON Map Viewer — Simon Willison · 2026-09-01
- datasette-mcp 0.2 — Simon Willison · 2026-09-01
- Claude Fable 5.1 made me a really nice animated pelican — Simon Willison · 2026-09-01
- I trained a small transformer in 1.5hrs and it beats many LLMs — Hacker News · 2026-09-01
- S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? — HF Papers
- Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills — HF Papers
- ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval — HF Papers
- Muse Spark 1.3 — Hacker News · 2026-09-02
- Post-Training Language Models for Gold-Medal Performance in Coding Competitions — arXiv · 2026-09-02
- llm-gemini 0.34 — Simon Willison · 2026-09-02
- Claude’s new system prompt really doesn’t want to reproduce song lyrics — Simon Willison · 2026-09-02
- Quoting Rick Brewster — Simon Willison · 2026-09-02
- BenchMIRT: What are LLM benchmarks actually measuring? — Hugging Face · 2026-09-01
- Codex bundles LibreOffice — Simon Willison · 2026-09-01
- Introducing agentic video understanding with Gemini — Google DeepMind · 2026-09-01
- Quoting Tarn Adams — Simon Willison · 2026-09-01
- CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing — HF Papers
- SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models — HF Papers
V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.