Xiaomi publie un robot humanoïde complet avec SDK open-source

5 min de lecture

Xiaomi publie un robot humanoïde complet avec SDK open-source · OpenAI détaille les risques de sécurité des modèles long-horizon · NVIDIA sort Cosmos 3 ...

🎧 Écouter cet article

Version audio générée automatiquement — texte nettoyé pour une écoute fluide

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • Xiaomi publie un robot humanoïde complet avec SDK open-source [1]
  • OpenAI détaille les risques de sécurité des modèles long-horizon [14]
  • NVIDIA sort Cosmos 3 Edge, modèle de physique temps réel pour edge [13]

Les 3 signaux

🤖 Xiaomi Robotics-1 : robot humanoïde open-source

Xiaomi Robotics-1 : robot humanoïde open-source Xiaomi publie un robot humanoïde complet avec SDK, documentation et modèles de référence accessibles publiquement [1]. La page produit liste des spécifications techniques détaillées (articulations, capteurs, autonomie) sans préciser de prix ou de date de disponibilité commerciale [1]. Pourquoi ça compte : un SDK open-source pour robot humanoïde permet aux équipes de prototyper des applications de manipulation et navigation sans construire le hardware.

⚠️ OpenAI : safety alignment pour modèles long-horizon

OpenAI : safety alignment pour modèles long-horizon OpenAI publie un rapport sur les risques de sécurité observés lors du déploiement de modèles à longue durée d’exécution, listant des défaillances spécifiques et les contre-mesures itératives mises en place [14]. Le document couvre les attaques par corruption d’état mémoire (self-state attacks) et les échecs de raisonnement temporel [14]. Pourquoi ça compte : les équipes déployant des agents autonomes doivent intégrer ces garde-fous dès la conception, sous peine de défaillances non détectées sur des sessions longues.

NVIDIA Cosmos 3 Edge : modèle physique temps réel embarqué

NVIDIA Cosmos 3 Edge : modèle physique temps réel embarqué NVIDIA publie Cosmos 3 Edge, un modèle de simulation physique optimisé pour l’inférence sur dispositifs edge [13]. Le modèle est disponible sur Hugging Face avec des poids et un pipeline d’inférence documenté [13]. Pourquoi ça compte : une simulation physique temps réel sur edge permet de déplacer la planification de mouvement du cloud vers le robot, réduisant la latence et la dépendance réseau.

À retenir

  1. Xiaomi Robotics-1 — SDK open-source complet pour robot humanoïde, documentation et modèles de référence disponibles [1]
  2. Cosmos 3 Edge — modèle physique temps réel pour edge, publié sur Hugging Face par NVIDIA [13]
  3. Self-state attacks — OpenAI documente les risques de corruption mémoire des agents auto-hébergés via appels système légitimes [14]

🔍 Radar Contradictions

Claim : Les modèles de génération vidéo modernes sont présentés comme des « modèles du monde » maîtrisant les lois physiques [18].
Contre-signal : Le benchmark Apple-π montre que ces modèles ne sont évalués qu’au niveau de la plausibilité de sortie, sans vérifier un raisonnement fidèle aux lois physiques [18].
Ce que ça change pour un dev : Ne pas se fier à la plausibilité visuelle d’une vidéo générée comme preuve de compréhension physique réelle du modèle.

⏱ Reproduit en 15 min

Repo/Snippet : Grabette – an open system to record robot-manipulation data [3] Comment tester : 1. Clone le dépôt Hugging Face. 2. Suis le README pour lancer l’enregistrement avec un bras robotique supporté. 3. Vérifie la sortie au format standardisé. Prérequis : Python, ROS 2, un bras robotique compatible (ex. Franka Emika). Références : [3]

📊 Track Record

Ce qu’on disait le 2026-07-07 : « GLM 5.2 atteint des coûts d’inférence 10× inférieurs aux modèles propriétaires, signalant un effondrement des marges IA » Verdict aujourd’hui : partiellement tenu. Le 2026-07-05, GLM-5.2 sur AMD atteint un nouveau record de performance par dollar [2], confirmant la pression sur les coûts. Cependant, aucun élément récent ne valide un effondrement généralisé des marges ; le signal reste circonscrit à ce modèle spécifique.

🕳 Sous le radar

L’item : FM-VLA: Force-based Memory for Vision-Language-Action Models [4] (arXiv, 0 citations) Pourquoi c’est du signal : Propose une mémoire basée sur la force (tactile) plutôt que sur des images passées pour les VLAs en manipulation, adressant un angle mort des approches visuelles pures dans les tâches à contact riche.

❓ Donnée manquante

L’annonce : « Introducing Cosmos 3 Edge » [13] Ce qui manque : Le coût d’inférence (latence, consommation mémoire, ou prix par requête) n’est pas divulgué. Pourquoi ça compte : Sans ces métriques, impossible d’évaluer si ce modèle edge est réellement déployable sur des appareils contraints, ce qui est la promesse centrale du produit.


🔗 Sources (18) — vérifiées le 21/07/2026 11:15 UTC

  1. Xiaomi-Robotics-1Hacker News · 2026-07-20
  2. Agent swarms and the new model economicsHacker News · 2026-07-20
  3. Grabette: an open system to record robot-manipulation dataHugging Face · 2026-07-21
  4. FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich ManipulationarXiv · 2026-07-20
  5. Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft PrefixesarXiv · 2026-07-20
  6. Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal InferencearXiv · 2026-07-20
  7. SWE-Pruner Pro: The Coder LLM Already Knows What to PrunearXiv · 2026-07-20
  8. Optimization of sim-to-real transfer in the humanoid robot NICOarXiv · 2026-07-20
  9. PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to ReasoningarXiv · 2026-07-20
  10. VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester DesignarXiv · 2026-07-20
  11. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal ApplicationsarXiv · 2026-07-20
  12. TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory MinimizationarXiv · 2026-07-20
  13. Introducing Cosmos 3 EdgeHugging Face · 2026-07-20
  14. Safety and alignment in an era of long-horizon modelsOpenAI · 2026-07-20
  15. Can Multimodal Large Language Models Understand OCT?HF Papers
  16. DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentHF Papers
  17. Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?HF Papers
  18. Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical IntelligenceHF Papers

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 21/07/2026 à 11:15 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Pas de spam. Désabonnement en 1 clic.