Qwen 3.8 27B sort sous licence Apache 2, mais sur-réfléchit par défaut

· 6 min de lecture

Qwen 3.8 27B sort sous licence Apache 2, mais sur-réfléchit par défaut · Simon Willison publie CORS Chat, UI web pour tester des endpoints compatibles O...

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • Qwen 3.8 27B sort sous licence Apache 2, mais sur-réfléchit par défaut [6]
  • Simon Willison publie CORS Chat, UI web pour tester des endpoints compatibles OpenAI-Responses [1]
  • Maglev introduit une architecture Transformer récurrente à mémoire fixe, parallélisable en entraînement [2]

Les 3 signaux

🚀 Qwen 3.8 27B : puissant mais bavard

Qwen 3.8 27B : puissant mais bavard Qwen 3.8 27B est un LLM de 27B paramètres avec capacité vision, sous licence Apache 2, publié par le laboratoire Qwen d’Alibaba [6]. La taille 27B est adaptée pour tourner sur un laptop correctement équipé [6]. Le problème : le modèle « sur-réfléchit » par défaut, produisant des chaînes de raisonnement excessives [6]. Simon Willison l’a testé via LM Studio sur son M5 MacBook Pro et un NVIDIA DGX Spark [1].

Pourquoi ça compte : alternative open-source viable pour de l’inférence locale, mais vous devrez probablement ajuster les paramètres de raisonnement pour éviter une latence inutile en production.

🧠 Maglev : mémoire récurrente glissante

Maglev : mémoire récurrente glissante Maglev est une architecture Transformer récurrente avec mémoire de taille fixe qui généralise l’attention à fenêtre glissante tout en restant parallélisable en entraînement [2]. Elle combine deux modèles couplés : un pré-remplisseur Q utilisant une attention complète, avec une alternance d’attention pleine et fenêtrée en pratique [2].

Pourquoi ça compte : si cette architecture tient ses promesses, elle permet de traiter des séquences longues avec un coût mémoire borné, sans sacrifier la parallélisation à l’entraînement.

🛠️ CORS Chat : outil de test pour endpoints compatibles OpenAI

CORS Chat : outil de test pour endpoints compatibles OpenAI Simon Willison a construit CORS Chat en une journée avec GPT-5.6-Sol xhigh [1]. L’outil fournit une UI web pour exercer un endpoint de chat compatible OpenAI-Responses [1]. Il l’a testé contre LM Studio avec l’option --cors et contre OpenRouter [1].

Pourquoi ça compte : si vous développez avec des modèles locaux ou via des proxies, cet outil simplifie le test d’interopérabilité des endpoints sans écrire de client custom.

À retenir

  1. 27B paramètres pour Qwen 3.8, sous licence Apache 2, avec capacité vision [6]
  2. 2 modèles couplés dans Maglev : un pré-remplisseur Q et un modèle récurrent à mémoire fixe [2]
  3. 1 journée de développement pour CORS Chat, construit avec GPT-5.6-Sol xhigh [1]

🛠 Tuto du jour

Tuto / Outil : CORS Chat [1] Ce qu’on installe : Une interface web pour tester un endpoint chat compatible OpenAI-Responses, utilisée avec Qwen 3.8 27B sous LM Studio. Prérequis hardware & commande : M5 MacBook Pro ou NVIDIA DGX Spark ; lancement de LM Studio avec l’option --cors [1].

💻 Matos & Infra local

Sujet Matos/Infra : Qwen 3.8 27B sur Mac M5 et DGX Spark [1][6] Constat technique : Simon Willison teste Qwen 3.8 27B (Apache 2, vision) sur MacBook Pro M5 et NVIDIA DGX Spark via LM Studio. Il juge 27B comme une taille idéale pour un laptop raisonnablement équipé, mais note un défaut de “sur-réflexion” par défaut [6]. Recommandation dev : Prévoir une configuration de température ou un prompt système limitant la longueur des raisonnements pour ce modèle.

🎯 Fine-Tuning & Quantiz

Technique / Outil : Approximate Muon with low-rank adapters [16] Apport : Rend le combinaison de l’optimiseur Muon avec LoRA mathématiquement possible pour le fine-tuning paramétrique efficace (PEFT) [16]. Impact pratique : Permet d’appliquer les bénéfices de Muon aux méthodes PEFT, domaine où son usage était limité [16].

Technique / Outil : Rollplex [15] Apport : Partage spatial GPU inter-phase pour le post-entraînement RL des VLM, réduisant la sérialisation stricte des phases [15]. Impact pratique : Améliore l’efficacité des runtimes RL on-policy pour les modèles de vision-langage [15].

🧠 RAG & Agents Locaux

Architecture / Outil : CORS Chat [1] Cas d’usage : Interface web pour tester un endpoint de chat compatible OpenAI-Responses contre Qwen 3.8 27B exécuté localement via LM Studio [1]. Clé de voûte : Utilise l’option --cors de LM Studio pour autoriser les requêtes du navigateur vers le modèle local [1].

📊 Track Record

Ce qu’on disait le 2026-08-03 : β-OPSD identifie l’instabilité de l’auto-distillation on-policy comme un cas limite β=1 d’une famille plus large [11] Verdict aujourd’hui : en attente. Le papier “Latent On-Policy Self-Distillation” [8] propose une méthode alternative sans référence explicite à β-OPSD, mais confirme l’intérêt pour ce champ. Aucun élément ne valide ou infirme la caractérisation théorique de β-OPSD.


🔗 Sources (18) — vérifiées le 17/08/2026 05:00 UTC

  1. CORS ChatSimon Willison · 2026-08-15
  2. Maglev: Sliding Recurrent MemoryHF Papers
  3. Expected Free Energy-based Informative Path Planning for Robotic Mars ExplorationarXiv · 2026-08-14
  4. SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet ReasoningarXiv · 2026-08-14
  5. Markdown SVG upgradesSimon Willison · 2026-08-16
  6. Qwen 3.8 27B is excellent, but it defaults to wildly overthinking thingsSimon Willison · 2026-08-16
  7. Quoting Dario AmodeiSimon Willison · 2026-08-16
  8. Latent On-Policy Self-DistillationHF Papers
  9. MobileMem: Learning from a Year of Mobile ExperiencesHF Papers
  10. Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding PredictionHF Papers
  11. RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived ProjectionsHF Papers
  12. Patterns and problems in emerging multi-agent systemsHacker News · 2026-08-16
  13. Handover of In-Context Learning State Across Session BoundariesarXiv · 2026-08-14
  14. Universal Thermodynamic Interatomic Potentials for Crystalline MaterialsarXiv · 2026-08-14
  15. Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-TrainingarXiv · 2026-08-14
  16. Approximate Muon with low-rank adaptersarXiv · 2026-08-14
  17. Twin: Playing an Unknown Game with a Test-Time Digital TwinarXiv · 2026-08-14
  18. THRIVE: Therapeutic Humanoid Robot In Virtual EnvironmentarXiv · 2026-08-14

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 17/08/2026 à 05:00 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Zéro spam. Désabonnement instantané en 1 clic.