LFM2.5-DSpark accélère l'inférence jusqu'à 3,2×

· 5 min de lecture

LFM2.5-DSpark accélère l'inférence jusqu'à 3,2× · Bun 1.4 sort en stable, première version depuis le rewrite Rust · oMLX écrit le cache KV sur SSD, acti...

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • LFM2.5-DSpark accélère l’inférence jusqu’à 3,2× [2]
  • Bun 1.4 sort en stable, première version depuis le rewrite Rust [11]
  • oMLX écrit le cache KV sur SSD, active le cache d’office [3]

Les 3 signaux

⚡ Inférence — Liquid AI publie LFM2.5-DSpark avec des gains d’inférence jusqu’à 3,2× [2]. Les détails techniques restent sur Hugging Face, mais l’ordre de grandeur est net pour qui cherche à réduire la latence ou les coûts de serving.

Inférence

Pourquoi ça compte : 3,2× de débit en plus sur le même hardware, soit une baisse directe de la facture d’inférence ou une montée en charge sans ajout de GPU.

🖥️ Runtime — Bun 1.4 sort en version stable, la première depuis le rewrite Rust [11]. La release introduit Bun.WebView, et Simon Willison a déjà testé une API JSON style shot-scraper dessus [11]. Le rewrite Rust est minimisé dans les notes de version, mais le runtime est reparti sur une base neuve.

Pourquoi ça compte : Bun.WebView ouvre une voie pour exposer des APIs JSON depuis une WebView embarquée, sans serveur séparé — un pattern utile pour des outils locaux légers.

💾 Cache local — oMLX écrit le cache KV des modèles sur le SSD au lieu de le garder en mémoire, ce qui évite le recalcul complet du contexte à la reprise d’une session [3]. Le cache est actif par défaut et vise 10 % de l’espace disque [3].

Pourquoi ça compte : les sessions longues sur Apple Silicon reprennent instantanément sans repasser par le calcul du contexte, au prix d’un usage disque borné à 10 %.

À retenir

  1. 3,2× — accélération d’inférence annoncée pour LFM2.5-DSpark [2]
  2. 1.4 — première version stable de Bun depuis le rewrite Rust, avec Bun.WebView [11]
  3. 10 % — quota disque visé par oMLX pour le cache KV persistant [3]

🛠 Tuto du jour

Tuto / Outil : oMLX – serveur LLM local sur Mac Apple Silicon [3] Ce qu’on installe : Un serveur LLM local qui écrit le cache KV des modèles sur SSD au lieu de la RAM. Prérequis hardware & commande : Mac Apple Silicon ; cache actif d’office, visant 10 % du disque.

💻 Matos & Infra local

Sujet Matos/Infra : oMLX – agents IA locaux sur Mac Apple Silicon [3] Constat technique : Le cache KV est écrit sur le SSD au lieu de la RAM, évitant un recalcul complet du contexte à la reprise d’une session ; le cache consomme par défaut 10 % du disque. Recommandation dev : Pour les sessions longues sur Mac, activez cette option afin de réduire la latence de reprise, en surveillant l’espace disque alloué.

🎯 Fine-Tuning & Quantiz

Technique / Outil : oMLX – cache KV sur SSD pour LLM local [3] Apport : écrit le cache KV sur SSD au lieu de la RAM ; reprendre une session évite le recalcul complet du contexte [3] Impact pratique : Active le cache par défaut, visant 10 % de l’espace disque, au prix d’une latence accrue [3] Technique / Outil : MidTool – synthèse de données pour mid-training agentique [9] Apport : renforce les capacités agentiques via un mid-training ciblé sur l’usage d’outils [9] Impact pratique : applicable aux contextes d’ingénierie logicielle pour améliorer les compétences de raisonnement [9]

🧠 RAG & Agents Locaux

Architecture / Outil : oMLX [3] Cas d’usage : Exécution d’agents IA en local sur Mac Apple Silicon, avec reprise de session sans recalcul complet du contexte [3]. Clé de voûte : Cache KV écrit sur SSD (10 % du disque) au lieu de la RAM, activé par défaut [3].

📊 Track Record

Ce qu’on disait le 2026-08-06 : Liquid AI déploie LFM2.5-2.6B pour agents locaux [3] Verdict aujourd’hui : partiellement tenu. Liquid AI confirme la dynamique avec LFM2.5-DSpark, annonçant une inférence jusqu’à 3,2x plus rapide [2]. Le déploiement local est renforcé par l’arrivée d’oMLX, qui optimise le cache KV sur SSD pour les Mac Apple Silicon [3]. La promesse initiale d’agents locaux efficaces se concrétise via ces deux avancées.


🔗 Sources (18) — vérifiées le 21/08/2026 05:01 UTC

  1. Feature Request: Support AGENTS.mdHacker News · 2026-08-19
  2. Up to 3.2x Faster Inference with LFM2.5-DSparkHugging Face · 2026-08-20
  3. oMLX – Faites tourner vos agents IA en local sur votre MacKorben · 2026-08-20
  4. Le CD de Quake était foireux avant même d’être presséKorben · 2026-08-19
  5. Repo0: Design-Driven Zero-to-All Code GenerationHF Papers
  6. EXIMO: VLM Guided Exploration of VLA PoliciesHF Papers
  7. AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementarXiv · 2026-08-20
  8. Pandora’s AI Model Routing Box: Efficient Allocation with Costly Value EstimationarXiv · 2026-08-20
  9. MidTool: Mid-training Data Synthesis for Agentic Tool UsearXiv · 2026-08-20
  10. ChatGPT search now uses the site:operator at scaleSimon Willison · 2026-08-20
  11. A shot-scraper-style JSON API on Bun 1.4’s new Bun.WebViewSimon Willison · 2026-08-20
  12. smolmachines / smolvm as a sandbox for untrusted Python & JavaScriptSimon Willison · 2026-08-19
  13. Quoting Jeremy MorrellSimon Willison · 2026-08-19
  14. FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisHF Papers
  15. EnvHarness: Awakening Static Worlds for Agent LearningHF Papers
  16. PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsHF Papers
  17. Bounded Agents: Delegation Security for Multi-Agent AI SystemsHF Papers
  18. SkillGate: Training In-Policy Skill Selection in Long-Horizon AgentsHF Papers

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 21/08/2026 à 05:01 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Zéro spam. Désabonnement instantané en 1 clic.