Xiaomi publie Xiaomi-Robotics-1, un modèle VLA entraîné sur plus de 100 000 heures de trajectoire...

5 min de lecture

Xiaomi publie Xiaomi-Robotics-1, un modèle VLA entraîné sur plus de 100 000 heures de trajectoires réelles · AV-Flamingo sort en open-source, traite aud...

🎧 Écouter cet article

Version audio générée automatiquement — texte nettoyé pour une écoute fluide

Partager ce rapport :

X / Twitter LinkedIn

TL;DR

  • Xiaomi publie Xiaomi-Robotics-1, un modèle VLA entraîné sur plus de 100 000 heures de trajectoires réelles [12]
  • AV-Flamingo sort en open-source, traite audio + vidéo longue simultanément [16]
  • Cura 1T spécialise un LLM pour la santé [15]

Les 3 signaux

🏭 Xiaomi-Robotics-1 : VLA fondationnel à plus de 100 000 heures

Xiaomi-Robotics-1 : VLA fondationnel à plus de 100 000 heures Xiaomi publie un modèle vision-langage-action (VLA) capable d’exécuter des instructions variées en manipulation mobile dans des environnements inédits, sans réglage préalable [12]. Le modèle s’adapte à de nouvelles tâches avec un minimum de données de fine-tuning [12]. L’entraînement repose sur plus de 100 000 heures de trajectoires réelles [12]. Pourquoi ça compte : un VLA avec cette couverture de données permet d’exécuter des tâches de manipulation mobile sans réentraînement, réduisant le coût d’adaptation à un nouvel environnement.

🎬 AV-Flamingo : modèle audio-vidéo long open-source

AV-Flamingo : modèle audio-vidéo long open-source Audio-Visual Flamingo (AV-Flamingo) est un modèle audio-visuel LLM entièrement ouvert, conçu pour la compréhension et le raisonnement conjoints sur l’audio, les images et les vidéos longues [16]. Contrairement aux AV-LLM existants limités aux clips courts, AV-Flamingo traite des vidéos de longue durée [16]. Pourquoi ça compte : une alternative open-source viable aux modèles propriétaires pour l’analyse de vidéos longues avec audio.

🏥 Cura 1T : LLM spécialisé santé

Cura 1T : LLM spécialisé santé Cura 1T est un modèle spécialisé pour la santé couvrant la consultation patient, le raisonnement clinique sur texte et images, le diagnostic interactif et l’utilisation d’outils EHR [15]. Le modèle est entraîné pour gérer à la fois la communication à enjeux élevés, le raisonnement expert et l’exécution de workflows [15]. Pourquoi ça compte : un modèle spécialisé santé peut remplacer plusieurs modèles distincts (consultation, imagerie, dossier patient) par une seule instance, simplifiant l’infrastructure.

À retenir

  1. Plus de 100 000 heures de trajectoires réelles pour Xiaomi-Robotics-1 [12]
  2. Cura 1T est spécialisé santé avec capacités multimodales et outillage EHR [15]
  3. AV-Flamingo est un AV-LLM open-source conçu pour les vidéos longues, pas seulement les clips courts [16]

🔍 Radar Contradictions

Claim : Xiaomi-Robotics-1 is a foundational VLA model capable of performing mobile manipulation tasks in unseen environments out-of-the-box [12]. Contre-signal : L’étude sur Muon en RL post-training utilise des comparaisons single-seed sur ALFWorld, une méthodologie qui ne permet pas de conclure sur la robustesse hors-distribution revendiquée [3]. Ce que ça change pour un dev : Les performances “out-of-the-box” annoncées doivent être vérifiées avec des benchmarks multi-seed avant d’intégrer ce modèle dans une pipeline de production.

⏱ Reproduit en 15 min

Repo/Snippet : RESOURCE2SKILL [10] Comment tester : 1. Cloner le dépôt (lien dans le papier HF). 2. Lancer le pipeline d’extraction sur un tutoriel vidéo exemple fourni. 3. Vérifier la skill générée dans le dossier de sortie. Prérequis : Python, PyTorch, GPU (recommandé).

📊 Track Record

Ce qu’on disait le 2026-07-02 : « Weave Robotics lance Isaac 1, robot domestique à 7 999 $, livraisons automne 2026 » [8] Verdict aujourd’hui : en attente. Aucune mise à jour sur les livraisons ou le statut d’Isaac 1 n’apparaît dans les éléments du jour. Le signal reste non vérifié jusqu’à l’automne 2026.

🕳 Sous le radar

L’item : BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference [7] (arXiv, faible citations) Pourquoi c’est du signal : Propose une méthode sans réentraînement coûteux pour l’estimation de pose en manipulation, combinant vision et toucher via inférence bayésienne. L’approche Simulation-Based Inference évite les pipelines supervisés rigides, ce qui est rare et utile pour la robotique contact-rich.

❓ Donnée manquante

L’annonce : Xiaomi-Robotics-1, un modèle VLA entraîné sur “over 100K hours of real-world trajectories” [12]. Ce qui manque : Le nombre exact d’heures (100K est un seuil minimal), la composition détaillée des données (ratio manipulation mobile vs. autres tâches), et les conditions exactes de collecte (nombre de robots, environnements distincts). Pourquoi ça compte : Sans ces détails, il est impossible d’évaluer la reproductibilité, la généralisation réelle, ou de comparer l’efficacité data avec d’autres approches.


🔗 Sources (18) — vérifiées le 20/07/2026 11:15 UTC

  1. Xiaomi-Robotics-1Hacker News · 2026-07-20
  2. Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle VulnerabilitiesarXiv · 2026-07-17
  3. When Does Muon Help Agentic Reinforcement Learning?arXiv · 2026-07-17
  4. PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety AssessmentarXiv · 2026-07-17
  5. VTLoc: Learning-based Tactile Contact Localization in Visual Point CloudsarXiv · 2026-07-17
  6. When Do Multi-Agent Systems Help? An Information Bottleneck PerspectivearXiv · 2026-07-17
  7. BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based InferencearXiv · 2026-07-17
  8. The Honest Quorum Problem: Epistemic Byzantine Fault Tolerance for Agentic InfrastructurearXiv · 2026-07-17
  9. Understanding Reasoning from Pretraining to Post-TrainingarXiv · 2026-07-17
  10. RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal ResourcesHF Papers
  11. S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and GenerationHF Papers
  12. Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World TrajectoriesHF Papers
  13. DSWorld: A Data Science World Model for Efficient Autonomous AgentsHF Papers
  14. Recursive Harness Self-ImprovementHF Papers
  15. Cura 1T: Specialized Model for Agentic HealthcareHF Papers
  16. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex VideosHF Papers
  17. From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review QualityHF Papers
  18. RecGPT-V3 Technical ReportHF Papers

V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.

Sources vérifiées le 20/07/2026 à 11:15 UTC · Notre méthode

Vous avez aimé ce rapport ?

Recevez les prochains directement dans votre boîte mail, chaque matin.

Pas de spam. Désabonnement en 1 clic.