Qwen 3.8 27B atteint 1500 tokens/s sur Cerebras

· 6 min de lecture

Qwen 3.8 27B atteint 1500 tokens/s sur Cerebras · llm-gemini 0.34 ajoute gemini-3.8-flash avec trois niveaux de thinking · Anthropic publie les system p...

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • Qwen 3.8 27B atteint 1500 tokens/s sur Cerebras [4]
  • llm-gemini 0.34 ajoute gemini-3.8-flash avec trois niveaux de thinking [7]
  • Anthropic publie les system prompts de Claude, y compris l’historique des modifications [8]

Les 3 signaux

⚡ Inférence ultra-rapide pour Qwen 3.8 27B

Inférence ultra-rapide pour Qwen 3.8 27B Qwen 3.8 27B est disponible sur Cerebras à 1500 tokens/s [4]. Le modèle hybride combine 48 couches Gated DeltaNet et 16 couches attention [11]. Une étude montre que la quantification 4-bit NVFP4 fonctionne sur la partie récurrente, laissant le bloc GDN en 8- ou 16-bit pour préserver decay et write [11].

Pourquoi ça compte : 1500 tokens/s rend l’inférence de modèles 27B viable pour des applications temps réel, et la quantification 4-bit du bloc récurrent ouvre la voie à des coûts d’inférence réduits sans perte de qualité.

🧠 Mémoire persistante pour agents de code

Mémoire persistante pour agents de code Hugging Face publie un système de mémoire pour agents de codage [2]. En parallèle, le framework SENTINEL-RL décharge le raisonnement topologique des agents LLM dans les SOC : le contexte fini ne peut pas contenir un graphe d’authentification de plusieurs milliers d’hôtes, et la génération libre ne garantit pas une action de confinement correcte [5].

Pourquoi ça compte : la mémoire externe et le déchargement de raisonnement spécialisé répondent à la limitation centrale des agents LLM en production — le contexte fini — et permettent de traiter des graphes de données trop grands pour une fenêtre de contexte.

🎨 Édition visuelle éditable et compilation par entraînement

Édition visuelle éditable et compilation par entraînement Deux papiers proposent des alternatives aux approches dominantes. Le premier remplace le fine-tuning coûteux des sélecteurs listwise en Text-to-SQL par une sélection sans entraînement [12]. Le second, « compile by training », transforme une spécification en langage naturel en fonction neuronale locale, évitant les appels répétés à un modèle distant [14].

Pourquoi ça compte : ces approches réduisent la dépendance aux API distantes et les coûts d’inférence associés, tout en offrant des alternatives open-source viables pour des tâches répétitives.

À retenir

  1. 1500 tokens/s — débit de Qwen 3.8 27B sur Cerebras [4]
  2. gemini-3.8-flash — nouveau modèle dans llm-gemini 0.34, avec niveaux low, medium et high thinking [7]
  3. 48 couches GDN — sur 64 couches totales de Qwen 3.8 27B, quantifiables en 4-bit NVFP4 [11]

🛠 Tuto du jour

Tuto / Outil : llm-gemini 0.34 [7] Ce qu’on installe : Plugin pour l’outil en ligne de commande llm, ajoutant le modèle Gemini 3.8 Flash. Prérequis hardware & commande : Aucun GPU requis (API cloud) ; installation via llm install llm-gemini puis configuration de la clé API.

💻 Matos & Infra local

Sujet Matos/Infra : Quantification 4-bit d’un LLM hybride 27B [11] Constat technique : La quantification NVFP4 W4A4 de Qwen3.8-27B (48 couches Gated DeltaNet, 16 couches attention) échoue si le bloc récurrent reste en 8/16-bit ; la quantification 4-bit de la moitié récurrente est viable. Recommandation dev : Pour l’inférence locale quantifiée, ciblez la quantification 4-bit des couches récurrentes afin de réduire la VRAM sans dégrader la qualité.

🎯 Fine-Tuning & Quantiz

Technique / Outil : Quantification NVFP4 W4A4 de Gated DeltaNet [11] Apport : Survie en 4-bit pour la moitié récurrente d’un LLM hybride 27B, là où les premières quantifications laissaient le bloc en 8/16-bit [11]. Impact pratique : Permet une quantification plus agressive des couches GDN, réduisant la mémoire sans dégrader la stabilité du modèle [11]. [11] https://huggingface.co/papers/2609.04098

🧠 RAG & Agents Locaux

Architecture / Outil : SENTINEL-RL [5] Cas d’usage : Décharger le raisonnement topologique des agents LLM dans un SOC pour analyser des graphes d’authentification trop vastes pour le contexte [5]. Clé de voûte : Externalisation du raisonnement hors du LLM pour garantir des actions de confinement fiables à l’échelle entreprise [5].

📊 Track Record

Ce qu’on disait le 2026-08-17 : « Qwen 3.8 27B sort sous licence Apache 2, mais sur-réfléchit par défaut » [6] Verdict aujourd’hui : partiellement tenu. Le modèle est désormais disponible sur Cerebras à 1500 tokens/s [4], et des travaux récents portent sur sa quantification 4-bit [11], confirmant sa diffusion. La sur-réflexion par défaut n’est pas documentée dans les éléments du jour.


🔗 Sources (18) — vérifiées le 04/09/2026 05:00 UTC

  1. Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO StepsHugging Face · 2026-09-03
  2. Give Your Coding Agents a Memory You OwnHugging Face · 2026-09-03
  3. Muse Spark 1.3Hacker News · 2026-09-02
  4. Qwen 3.8 27B available on Cerebras at 1500 tokens/sHacker News · 2026-09-03
  5. SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations CenterarXiv · 2026-09-03
  6. Formation Matrix and Energy-based Control of Multi-Agent SystemsarXiv · 2026-09-03
  7. llm-gemini 0.34Simon Willison · 2026-09-02
  8. Claude’s new system prompt really doesn’t want to reproduce song lyricsSimon Willison · 2026-09-02
  9. Quoting Rick BrewsterSimon Willison · 2026-09-02
  10. Editable Visual DesignHF Papers
  11. Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLMHF Papers
  12. Replacing Training with Memory: Listwise Selection for Text-to-SQLHF Papers
  13. Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of TokensHF Papers
  14. Compile by Training: Turning Natural-Language Specifications into Local Neural FunctionsarXiv · 2026-09-03
  15. One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video EditingarXiv · 2026-09-03
  16. Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video CaptioningarXiv · 2026-09-03
  17. A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research SwarmsarXiv · 2026-09-03
  18. From Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception ResearcharXiv · 2026-09-03

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 04/09/2026 à 05:00 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Zéro spam. Désabonnement instantané en 1 clic.