Partager ce rapport :
TL;DR
- Z.ai publie GLM-5.3, « frontier coding » avec capacités cyber émergentes [2]
- Google sort Gemini 3.7 Flash, supporté par le plugin llm-gemini 0.33 [3][13]
- Grok Bot passe en bêta, lance des agents IA sur machine distante via SuperGrok Heavy à 300 $/mois [5]
Les 3 signaux
🧠 GLM-5.3 : le coding frontier avec un angle cyber
Z.ai publie GLM-5.3, positionné sur le « frontier coding » avec des « capacités cyber émergentes » [2]. Le post cumule 1056 points sur Hacker News [2]. Pas de benchmark chiffré dans les éléments, mais le positionnement « frontier » est explicite [2].
Pourquoi ça compte : si GLM-5.3 tient ses promesses en cyber, les pipelines de test de sécurité et les red teaming automatisés changent de dimension — un modèle qui code et trouve des failles en même temps modifie la donne pour les CI/CD.
⚡ Gemini 3.7 Flash : sortie immédiate, support plugin immédiat
Google lance Gemini 3.7 Flash [3]. Simon Willison sort le même jour llm-gemini 0.33 avec le support de Gemini 3.7 Flash, mais aussi gemini-3.6-flash, gemini-3.5-flash-lite et deux modèles d’embedding (gemini-embedding-2, gemini-embedding-001) [13]. Le plugin est mis à jour pour compatibilité [13].
Pourquoi ça compte : vous pouvez migrer vos appels LLM vers Gemini 3.7 Flash aujourd’hui via llm-gemini 0.33, sans attendre un SDK tiers — et les deux modèles d’embedding ajoutés élargissent les options de vectorisation sans changer d’outil.
🤖 Grok Bot : agents distants à 300 $/mois
La bêta de Grok Bot lance des agents IA sur une machine distante, sur Mac, iOS, Windows et Linux [5]. L’accès passe par l’abonnement SuperGrok Heavy à 300 $/mois [5]. Le modèle économique est clair : un abonnement premium pour déléguer des tâches à des agents hors de votre machine.
Pourquoi ça compte : si vous voulez tester des agents autonomes sans infrastructure locale, Grok Bot est une option clé en main — mais le coût de 300 $/mois le réserve aux usages à forte valeur, pas aux expérimentations ponctuelles.
À retenir
- 300 $/mois — prix de SuperGrok Heavy pour accéder à Grok Bot en bêta, agents sur machine distante [5]
- 0.33 — version du plugin llm-gemini qui supporte Gemini 3.7 Flash dès le jour de sa sortie [13]
- 189 fichiers — refactoring d’un invariant architectural dans une base de 717k lignes par un agent IA, sans revue humaine ni oracle de test [16]
🛠 Tuto du jour
Tuto / Outil : llm-gemini 0.33 [13] Ce qu’on installe : Plugin pour l’outil en ligne de commande
llm, ajoutant le support des modèles Gemini 3.7 Flash et autres. Prérequis hardware & commande : Aucun GPU requis (API cloud). Commande :llm install llm-gemini[13].
💻 Matos & Infra local
Sujet Matos/Infra : Grok Bot bêta : agents IA sur machine distante, Mac, iOS, Windows, Linux via abonnement SuperGrok Heavy à 300 $/mois [5] Constat technique : L’inférence est externalisée sur une machine distante, sans précision sur la configuration GPU/VRAM locale requise côté client. Recommandation dev : Surveiller ce modèle de déport d’inférence comme benchmark pour l’architecture des futurs outils d’agents locaux.
Sujet Matos/Infra : Visual Token Pruning pour MLLMs [8] Constat technique : L’élagage de tokens visuels réduit le coût d’inférence, mais les méthodes actuelles reposent sur des heuristiques manuelles coûteuses. Recommandation dev : Évaluer l’impact de ces techniques de pruning sur la VRAM et la latence pour l’inférence locale quantifiée.
🎯 Fine-Tuning & Quantiz
Technique / Outil : Aucun élément dédié au fine-tuning (LoRA, QLoRA, Axolotl, Unsloth) ou à la quantification (GGUF, EXL2, AWQ) n’est présent dans les sources fournies. Apport : Non applicable. Impact pratique : Non applicable. Pas de nouveauté fine-tuning ou quantification aujourd’hui.
🧠 RAG & Agents Locaux
Architecture / Outil : sqlite-utils 4.2.1 + LLM local [11][12] Cas d’usage : Tagging de contenu existant sans classification manuelle, via génération de tags par hallucination contrôlée [10]. Clé de voûte : Stratégie de prompteur demandant au modèle de générer des tags sans contrainte de liste, évitant la limite de contexte des 1 856 tags existants [10].
📊 Track Record
Ce qu’on disait le 2026-07-26 : Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber [3] Verdict aujourd’hui : partiellement tenu. Le 2026-08-13, Google publie Gemini 3.7 Flash, confirmant la cadence de mise à jour [3]. Le support de la 3.6 Flash est intégré au plugin llm-gemini 0.33 [13]. Aucune trace de la 3.5 Flash Cyber dans les éléments du jour.
🔗 Sources (18) — vérifiées le 15/08/2026 05:00 UTC
- Northern Gannet — Simon Willison · 2026-08-15
- GLM-5.3: Frontier coding with emergent cyber capabilities — Hacker News · 2026-08-14
- Gemini 3.7 Flash — Hacker News · 2026-08-13
- Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets — Hugging Face · 2026-08-13
- Grok Bot débarque en bêta — Korben · 2026-08-13
- Maglev: Sliding Recurrent Memory — HF Papers
- AVA-Encoder: Towards Agent-Native Video Representation Learning — HF Papers
- An AI4AI Framework for Visual Token Pruning — HF Papers
- Mistral OCR 4.1 — Hacker News · 2026-08-13
- Don’t classify. Hallucinate! — Simon Willison · 2026-08-14
- sqlite-utils 4.2.1 — Simon Willison · 2026-08-13
- sqlite-utils 4.2 — Simon Willison · 2026-08-13
- llm-gemini 0.33 — Simon Willison · 2026-08-13
- Bring your spreadsheet data to life with Sheets canvas — Google AI · 2026-08-13
- RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived Projections — HF Papers
- Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code revie — HF Papers
- SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models — HF Papers
- AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design — arXiv · 2026-08-13
V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.