Partager ce rapport :
TL;DR
- Qwen 3.8 27B atteint 1500 tokens/s sur Cerebras [4]
- llm-gemini 0.34 ajoute gemini-3.8-flash avec trois niveaux de thinking [7]
- Anthropic publie les system prompts de Claude, y compris l’historique des modifications [8]
Les 3 signaux
⚡ Inférence ultra-rapide pour Qwen 3.8 27B
Qwen 3.8 27B est disponible sur Cerebras à 1500 tokens/s [4]. Le modèle hybride combine 48 couches Gated DeltaNet et 16 couches attention [11]. Une étude montre que la quantification 4-bit NVFP4 fonctionne sur la partie récurrente, laissant le bloc GDN en 8- ou 16-bit pour préserver decay et write [11].
Pourquoi ça compte : 1500 tokens/s rend l’inférence de modèles 27B viable pour des applications temps réel, et la quantification 4-bit du bloc récurrent ouvre la voie à des coûts d’inférence réduits sans perte de qualité.
🧠 Mémoire persistante pour agents de code
Hugging Face publie un système de mémoire pour agents de codage [2]. En parallèle, le framework SENTINEL-RL décharge le raisonnement topologique des agents LLM dans les SOC : le contexte fini ne peut pas contenir un graphe d’authentification de plusieurs milliers d’hôtes, et la génération libre ne garantit pas une action de confinement correcte [5].
Pourquoi ça compte : la mémoire externe et le déchargement de raisonnement spécialisé répondent à la limitation centrale des agents LLM en production — le contexte fini — et permettent de traiter des graphes de données trop grands pour une fenêtre de contexte.
🎨 Édition visuelle éditable et compilation par entraînement
Deux papiers proposent des alternatives aux approches dominantes. Le premier remplace le fine-tuning coûteux des sélecteurs listwise en Text-to-SQL par une sélection sans entraînement [12]. Le second, « compile by training », transforme une spécification en langage naturel en fonction neuronale locale, évitant les appels répétés à un modèle distant [14].
Pourquoi ça compte : ces approches réduisent la dépendance aux API distantes et les coûts d’inférence associés, tout en offrant des alternatives open-source viables pour des tâches répétitives.
À retenir
- 1500 tokens/s — débit de Qwen 3.8 27B sur Cerebras [4]
- gemini-3.8-flash — nouveau modèle dans llm-gemini 0.34, avec niveaux low, medium et high thinking [7]
- 48 couches GDN — sur 64 couches totales de Qwen 3.8 27B, quantifiables en 4-bit NVFP4 [11]
🛠 Tuto du jour
Tuto / Outil : llm-gemini 0.34 [7] Ce qu’on installe : Plugin pour l’outil en ligne de commande
llm, ajoutant le modèle Gemini 3.8 Flash. Prérequis hardware & commande : Aucun GPU requis (API cloud) ; installation viallm install llm-geminipuis configuration de la clé API.
💻 Matos & Infra local
Sujet Matos/Infra : Quantification 4-bit d’un LLM hybride 27B [11] Constat technique : La quantification NVFP4 W4A4 de Qwen3.8-27B (48 couches Gated DeltaNet, 16 couches attention) échoue si le bloc récurrent reste en 8/16-bit ; la quantification 4-bit de la moitié récurrente est viable. Recommandation dev : Pour l’inférence locale quantifiée, ciblez la quantification 4-bit des couches récurrentes afin de réduire la VRAM sans dégrader la qualité.
🎯 Fine-Tuning & Quantiz
Technique / Outil : Quantification NVFP4 W4A4 de Gated DeltaNet [11] Apport : Survie en 4-bit pour la moitié récurrente d’un LLM hybride 27B, là où les premières quantifications laissaient le bloc en 8/16-bit [11]. Impact pratique : Permet une quantification plus agressive des couches GDN, réduisant la mémoire sans dégrader la stabilité du modèle [11]. [11] https://huggingface.co/papers/2609.04098
🧠 RAG & Agents Locaux
Architecture / Outil : SENTINEL-RL [5] Cas d’usage : Décharger le raisonnement topologique des agents LLM dans un SOC pour analyser des graphes d’authentification trop vastes pour le contexte [5]. Clé de voûte : Externalisation du raisonnement hors du LLM pour garantir des actions de confinement fiables à l’échelle entreprise [5].
📊 Track Record
Ce qu’on disait le 2026-08-17 : « Qwen 3.8 27B sort sous licence Apache 2, mais sur-réfléchit par défaut » [6] Verdict aujourd’hui : partiellement tenu. Le modèle est désormais disponible sur Cerebras à 1500 tokens/s [4], et des travaux récents portent sur sa quantification 4-bit [11], confirmant sa diffusion. La sur-réflexion par défaut n’est pas documentée dans les éléments du jour.
🔗 Sources (18) — vérifiées le 04/09/2026 05:00 UTC
- Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps — Hugging Face · 2026-09-03
- Give Your Coding Agents a Memory You Own — Hugging Face · 2026-09-03
- Muse Spark 1.3 — Hacker News · 2026-09-02
- Qwen 3.8 27B available on Cerebras at 1500 tokens/s — Hacker News · 2026-09-03
- SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center — arXiv · 2026-09-03
- Formation Matrix and Energy-based Control of Multi-Agent Systems — arXiv · 2026-09-03
- llm-gemini 0.34 — Simon Willison · 2026-09-02
- Claude’s new system prompt really doesn’t want to reproduce song lyrics — Simon Willison · 2026-09-02
- Quoting Rick Brewster — Simon Willison · 2026-09-02
- Editable Visual Design — HF Papers
- Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM — HF Papers
- Replacing Training with Memory: Listwise Selection for Text-to-SQL — HF Papers
- Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens — HF Papers
- Compile by Training: Turning Natural-Language Specifications into Local Neural Functions — arXiv · 2026-09-03
- One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing — arXiv · 2026-09-03
- Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning — arXiv · 2026-09-03
- A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms — arXiv · 2026-09-03
- From Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research — arXiv · 2026-09-03
V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.