Xiaomi stellt Roboter auf der World Robot Conference 2026 vor: In Peking rückt der Konzern eine mobile Forschungsplattform mit zwei Roboterarmen ins Rampenlicht. Entscheidend ist dabei weniger das noch namenlose Chassis als die Software. Xiaomi-Robotics-1 soll aus Sprache, Kamerabildern und dem aktuellen Zustand des Roboters unmittelbar Handlungen ableiten. Das System wurde mit mehr als 100.000 Stunden realer Manipulationsdaten vortrainiert und soll neue Aufgaben mit vergleichsweise wenigen Demonstrationen erlernen.
Die World Robot Conference 2026 hat am 19. August im Beiren Etrong International Exhibition and Convention Center in Beijing E-Town begonnen. Bis zum 23. August zeigen nach Angaben der Veranstalter mehr als 300 Aussteller über 2.000 Exponate; mehr als 150 Neuheiten sollen erstmals öffentlich präsentiert werden. Das Motto der Messe lässt sich mit „Koexistenz von Mensch und Maschine, Verzahnung von Produktion und Nachfrage“ übersetzen. Xiaomi passt mit seiner aktuellen Robotikplattform genau in dieses Programm: Statt einer einzelnen, fest einprogrammierten Showbewegung steht ein lernfähiges System für wechselnde Alltagsaufgaben im Mittelpunkt.
Xiaomi-Roboter auf der World Robot Conference 2026: Was ist tatsächlich zu sehen?
Die in Xiaomis offiziellen Demonstrationen verwendete Forschungsplattform besitzt eine fahrbare Basis, einen höhenverstellbaren Aufbau sowie zwei Roboterarme mit Greifern und Kameras. Sie kann sich in Wohnräumen zwischen Arbeitsbereichen bewegen und Gegenstände mit beiden Armen bearbeiten. Gezeigt werden unter anderem das Packen eines Koffers, das Aufräumen eines Sofas, das Einsortieren von Schuhen, das Nachfüllen eines Druckers, das Beladen einer Waschmaschine und das Verpacken von Gegenständen.
Wichtig für die Einordnung: Xiaomi hat für diese Hardware bislang keinen eigenständigen Produktnamen, keinen Preis und keinen Termin für einen kommerziellen Marktstart veröffentlicht. Auch Angaben zu Abmessungen, Traglast, Akkulaufzeit oder einer geplanten Serienfertigung fehlen. Der belastbar dokumentierte Name Xiaomi-Robotics-1 bezeichnet das KI-Grundmodell – also das „Gehirn“ der Demonstrationsplattform – und nicht zwingend einen Roboter, den Privatkunden bald bestellen können. Der Messeauftritt sollte deshalb als Präsentation eines Forschungs- und Entwicklungsstands verstanden werden, nicht als Verkaufsstart.
| Merkmal | Bekannter Stand |
|---|---|
| Plattform | Mobiler Forschungsroboter mit zwei Armen und Greifern |
| KI-System | Xiaomi-Robotics-1, ein Vision-Language-Action-Modell |
| Vortrainingsdaten | Mehr als 100.000 Stunden reale Manipulationstrajektorien |
| Nachtraining | Mehr als 10.000 Stunden körperübergreifende Daten, darunter über 7.200 Stunden mit realen Robotern in Wohnungen |
| Modellgrößen | Varianten mit rund 2, 5 und 10 Milliarden Parametern |
| Beispielaufgaben | Koffer packen, Sofa aufräumen, Wäsche laden, Drucker nachfüllen, Gegenstände verpacken |
| Preis und Marktstart | Nicht angekündigt |
Was Xiaomi-Robotics-1 von klassischer Roboterprogrammierung unterscheidet
Industrie- und Serviceroboter arbeiten traditionell besonders zuverlässig, wenn Umgebung, Objektpositionen und Bewegungsabläufe genau definiert sind. Wohnungen sind das Gegenteil davon: Kleidung liegt jedes Mal anders, Kartons verändern ihre Position, Schubladen sind unterschiedlich gefüllt und selbst scheinbar identische Gegenstände unterscheiden sich in Form oder Material. Für einen universelleren Haushaltsroboter reicht es daher nicht, eine starre Bewegungsfolge abzuspeichern.
Xiaomi-Robotics-1 gehört zur Klasse der Vision-Language-Action-Modelle, kurz VLA. Das Modell verarbeitet Bilder aus den Kameras, eine Anweisung in natürlicher Sprache und Zustandsdaten der Roboterarme. Daraus erzeugt es direkt eine Folge von Aktionen. Vereinfacht gesagt verbindet es Sehen, Sprachverständnis und Bewegung in einem einzigen lernenden System. Der Ansatz ähnelt den Skalierungsprinzipien großer Sprachmodelle: Mehr vielfältige Daten und größere Modelle sollen nicht nur einzelne Übungen verbessern, sondern allgemeinere Fähigkeiten entstehen lassen.
Technisch setzt Xiaomi auf eine „Mixture-of-Transformers“-Architektur. Ein auf Qwen3-VL basierendes Bild-Sprach-Modell interpretiert Szene und Anweisung; ein Diffusion Transformer erzeugt dazu passende Bewegungssequenzen. Xiaomi untersuchte Varianten mit etwa 2, 5 und 10 Milliarden Parametern. In den veröffentlichten Experimenten stieg die Erfolgsquote bei bisher unbekannten Umgebungen und Gegenständen mit wachsender Modellgröße und Datenmenge. Die Forscher berichten, dass die Skalierung in ihrem getesteten Bereich noch keine deutliche Sättigung zeigte.
100.000 Stunden Daten sollen den Engpass der Robotik lösen
Das zentrale Problem moderner Roboter-KI ist nicht allein Rechenleistung, sondern die Beschaffung geeigneter Bewegungsdaten. Ein Sprachmodell kann Milliarden Texte auswerten. Für einen Roboter müssen dagegen Menschen Bewegungen vormachen, Geräte teleoperieren oder reale Maschinen über lange Zeit Daten sammeln. Das ist teuer, langsam und häufig an eine bestimmte Hardware gebunden.
Xiaomi versucht, diesen Engpass mit sogenannten UMI-Daten zu umgehen. UMI steht für „Universal Manipulation Interface“. Dabei werden menschliche Manipulationsbewegungen in der realen Welt aufgezeichnet, ohne dass für jede Demonstration ein kompletter Roboter benötigt wird. Für das Vortraining sammelte Xiaomi nach eigenen Angaben mehr als 100.000 Stunden solcher Trajektorien aus über 1.700 Szenarien. Sie umfassen Wohnungen, Gewerberäume, Industrieumgebungen und Außenbereiche.
Eine automatische Pipeline zerlegt die Aufzeichnungen in Abschnitte und versieht sie mit Sprachbeschreibungen der jeweiligen Zustandsänderung. Anschließend folgt ein Nachtraining, das die allgemeinen Bewegungsmuster an konkrete Roboterkörper und direkte Anweisungen anpasst. Dafür nutzte Xiaomi insgesamt mehr als 10.000 Stunden körperübergreifender Daten. Allein mehr als 7.200 Stunden stammen von realen Robotern in echten Wohnungen – unter anderem beim Aufräumen von Sofas, beim Sortieren von Schuhschränken und beim Wegräumen von Küchenutensilien.
Dieser zweistufige Aufbau ist der eigentliche Kern der Präsentation. Das Modell soll zunächst aus einer großen, hardwareunabhängigen Datenbasis allgemeine Vorstellungen von Objektmanipulation lernen und diese Fähigkeiten danach auf einen konkreten Roboter übertragen. Gelingt das in größerem Maßstab, könnten Hersteller neue Robotermodelle trainieren, ohne für jedes Chassis wieder bei null zu beginnen.
Welche Leistungen Xiaomi veröffentlicht hat
Für den Einsatz ohne aufgabenspezifische Feinabstimmung testete Xiaomi vier Aufgaben in bislang unbekannten Umgebungen und mit neuen Objektinstanzen: Schuhe einräumen, eine Tasche packen, einen Tisch ordnen und ein Sofa aufräumen. Das Modell mit vollständigem Vortraining erreichte in der Studie über alle Aufgaben hinweg eine Erfolgsquote von 75 Prozent. Ohne das Vortraining auf den umfangreichen Aktionsdaten lag der Vergleichswert bei 26 Prozent. Bei den getesteten Modellgrößen stieg der Gesamtwert von 61 Prozent für die kleine über 75 Prozent für die mittlere auf 79 Prozent für die große Variante.
Zusätzlich wurde untersucht, wie schnell sich das System an neue, komplexere Aufgaben anpassen lässt. Mit durchschnittlich weniger als zehn Stunden Demonstrationsdaten pro Aufgabe kam Xiaomi-Robotics-1 beim Verpacken von Telefonen, Nachfüllen eines Druckers, Beladen einer Waschmaschine und Packen von Kartons auf 75 Prozent Gesamterfolg. Die von Xiaomi verwendete Vergleichsbasis π0.5 erreichte unter demselben Datenbudget 40 Prozent. Mit durchschnittlich weniger als 40 Stunden pro Aufgabe stieg Xiaomi auf 85 Prozent, während die Vergleichsmethode bei 53 Prozent lag.
Auch in vier Simulationsbenchmarks meldet das Team neue Spitzenwerte. Besonders deutlich ist der Abstand bei RoboCasa365: Die aktuelle Fassung der Studie nennt 57,6 Prozent gegenüber 46,6 Prozent für das zuvor beste Verfahren. Im RoboDojo-Benchmark erreicht Xiaomi einen Durchschnittswert von 20,07, verglichen mit 13,07 für den vorherigen Spitzenreiter. Solche Benchmarks ersetzen allerdings keinen unabhängigen Langzeittest in einer Wohnung. Sie zeigen vor allem, dass der Ansatz unter standardisierten Bedingungen gut generalisieren kann.
Koffer packen als Langzeittest
Eine der interessantesten Demonstrationen ist das autonome Packen eines Koffers über mehr als zehn Minuten. Der Roboter muss sich im Raum bewegen, verschiedene Kleidungsstücke und Gegenstände lokalisieren, sie greifen und im Gepäck verstauen. Damit verbindet die Aufgabe Navigation, Wahrnehmung, Greifplanung und eine längere Abfolge voneinander abhängiger Aktionen. In einem ungeschnittenen Video zeigt Xiaomi die komplette Sequenz und nicht nur ausgewählte erfolgreiche Einzelgriffe.
Trotzdem bleibt Vorsicht angebracht. Eine gelungene Demonstration sagt noch nicht, wie oft der Ablauf scheitert, wie das System auf Menschen oder Haustiere im Arbeitsbereich reagiert und welche Sicherheitsmechanismen im Dauerbetrieb greifen. Für einen kommerziellen Haushaltsroboter müssten außerdem niedrige Kosten, kompakte Abmessungen, leiser Betrieb und eine sehr hohe Zuverlässigkeit zusammenkommen. Gerade diese Produktfragen beantwortet Xiaomi bislang nicht.
Open Source: Xiaomi öffnet Teile des Systems für Entwickler
Anfang August stellte Xiaomi Code und ein Modell-Checkpoint öffentlich bereit. Das Repository enthält Werkzeuge für Nachtraining und Bereitstellung sowie die Client-Server-Laufzeit, die das Team für seine Evaluationen nutzt. Die Dokumentation beschreibt Eingaben von drei Kamerabildern, einer Sprachanweisung und dem aktuellen Zustand beider Roboterarme. Die Veröffentlichung steht unter der Apache-2.0-Lizenz und erlaubt Forschungsgruppen sowie Unternehmen, den Ansatz auf eigener Hardware zu testen und weiterzuentwickeln.
Damit setzt Xiaomi eine Linie fort, die bereits mit Xiaomi-Robotics-0 begann. Dieses Vorgängermodell zielte auf Echtzeitausführung mit verbrauchernaher GPU-Hardware. Ergänzend veröffentlichte das Team im Juli Xiaomi-Robotics-U0, ein 38-Milliarden-Parameter-Weltmodell, das konsistente Szenen und Interaktionen aus mehreren Kameraperspektiven erzeugen kann. U0 soll vor allem als Datenmotor dienen: synthetische Trainingssituationen können seltene oder teure reale Aufnahmen ergänzen.
Nicht CyberDog 2 und nicht CyberOne
Der auf der World Robot Conference 2026 gezeigte Ansatz darf nicht mit Xiaomis bekannten Showrobotern verwechselt werden. Der Xiaomi CyberOne ist ein humanoider Technologieträger, während CyberDog und CyberDog 2 vierbeinige, hundeähnliche Plattformen sind. Die aktuelle Xiaomi-Robotics-1-Demonstration setzt dagegen auf eine rollende Basis und zwei Arme. Das ist für Wohnungen weniger spektakulär, kann aber praktisch sein: Räder benötigen auf ebenem Boden weniger Energie als Beine, und zwei Arme erleichtern das Halten, Falten und Umräumen von Gegenständen.
Der Schwerpunkt passt zugleich zum breiteren Trend der „Physical AI“. Bei der WAIC 2026 und nun auf der WRC verschiebt sich die Aufmerksamkeit von kurzen Showeinlagen zu messbaren Arbeitsergebnissen. Wie unser Beitrag über den Zuverlässigkeitstest des Robotik-Booms zeigt, entscheidet am Ende nicht die eindrucksvollste Demo, sondern die Erfolgsquote über Tausende Wiederholungen in wechselnden Situationen.
World Robot Conference 2026 als Bühne für Chinas Robotikstrategie
Die WRC 2026 kombiniert Fachkonferenz, Ausstellung und Wettbewerb. Der Eröffnungstag ist als „Release Day“ für neue Produkte und Forschungsergebnisse konzipiert; weitere Thementage widmen sich Beschaffung, Entwicklern und dem Publikum. Nach offiziellen Angaben sind mehr als 60 Veranstaltungen geplant. Parallel richtet Beijing E-Town ein Konsumfestival mit einer „Roboterstraße“ aus, auf der Besucher Robotik in Gastronomie und Dienstleistungen erleben können.
Der Xiaomi-Auftritt zeigt dabei eine strategische Besonderheit: Der Konzern denkt Robotik nicht isoliert. Kameras, mobile Rechenplattformen, Sprachmodelle, Smart-Home-Infrastruktur und Fertigungskompetenz gehören bereits zum bestehenden Ökosystem. Ein lernfähiger Haushalts- oder Serviceroboter könnte diese Bausteine langfristig verbinden. Noch ist das jedoch eine Entwicklungsrichtung und kein bestätigtes Geschäftsmodell.
Einordnung: Starkes KI-Fundament, aber noch kein fertiges Produkt
Xiaomi-Robotics-1 ist technisch vor allem deshalb relevant, weil Xiaomi den Datenumfang deutlich vergrößert und die Ergebnisse transparent über mehrere Modellgrößen und Aufgaben vergleicht. Mehr als 100.000 Stunden Vortraining, über 10.000 Stunden Nachtraining und die Fähigkeit, neue Aufgaben mit wenigen Stunden Demonstrationsmaterial zu erlernen, markieren einen ambitionierten Schritt in Richtung universellerer Robotersteuerung.
Für Nutzer ist die wichtigste Nachricht zugleich die nüchternste: Xiaomi hat auf der World Robot Conference 2026 einen glaubwürdigen Forschungsstand für mobile Manipulation vorzuweisen, aber noch keinen kaufbaren Haushaltsroboter angekündigt. Preis, Liefertermin, Serienhardware und Sicherheitszertifizierung bleiben offen. Ob aus der Forschungsplattform ein Produkt wird, dürfte davon abhängen, ob Xiaomi die im Labor und in Testwohnungen gemessenen Erfolgsquoten in robuste, bezahlbare und wartungsarme Alltagstechnik übersetzen kann.
Quellen
- Xiaomi Robotics: Projektseite zu Xiaomi-Robotics-1
- Xiaomi Robotics Team: Forschungsarbeit zu Xiaomi-Robotics-1
- Offizielles Xiaomi-Robotics-1-Repository auf GitHub
- Beijing Municipal Government: Eckdaten zur World Robot Conference 2026
- Offizielle Website der World Robot Conference 2026
Bildnachweis: Xiaomi Robotics, Standbild aus dem offiziellen Demonstrationsvideo zu Xiaomi-Robotics-1.
![[Bildinhalt mit KI erstellt] Alpha Bionic [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/alpha-bionic-logo-bionic-flow-header-transparent.png)
![Xiaomi stellt Roboter auf der World Robot Conference 2026 vor 1 [Bildinhalt mit KI erstellt] Xiaomi-Robotics-1 Forschungsroboter mit zwei Armen auf mobiler Plattform [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/xiaomi-robotics-1-world-robot-conference-2026.jpg)
![Humanoide Roboter im Hotel: Pekings 30-Minuten-Test 2 [Bildinhalt mit KI erstellt] Humanoider Serviceroboter transportiert einen Koffer in einem Hotelzimmer [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/humanoide-roboter-hotel-whrg-2026.jpg)
![Xiaomi CyberDog 2: Roboterhund mit 19 Sensoren und 21 TOPS 3 [Bildinhalt mit KI erstellt] Xiaomi CyberDog 2 – smarter vierbeiniger Bio-Roboter [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/xiaomi-cyberdog-2-16x9-1.jpg)
![Pflegen, patrouillieren, desinfizieren: Warum Serviceroboter zu Allroundern werden 4 [Bildinhalt mit KI erstellt] Serviceroboter auf Rädern trägt in einer Pflegeeinrichtung ein Tablett, während Fachkraft und Bewohnerin in der Nähe bleiben [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/service-robot-care-security-disinfection-16x9-2.png)
![Unter Wasser verschwindet die Cloud: Der Härtetest für autonome Roboter 5 [Bildinhalt mit KI erstellt] Kompakter Unterwasserroboter passiert in einem tiefen Forschungsbecken ein orangefarbenes Tor mit Inspektions- und Bergungszielen [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/underwater-autonomous-robot-challenge-16x9-2.png)
![Der Robotik-Boom trifft auf seinen härtesten Test: Zuverlässigkeit 6 [Bildinhalt mit KI erstellt] Mobiler Feldroboter neben einem Belastungsprüfstand, während Ingenieure Zuverlässigkeitsdaten überwachen [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/robot-reliability-testing-16x9-2.png)
![Estun kommt: Der 50.000-Euro-Angriff auf Europas Robotermarkt 7 [Bildinhalt mit KI erstellt] Industrieroboter beladen Werkzeugmaschinen und bearbeiten Metall in einer mittelständischen deutschen Fabrik [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/estun-deutschland-robotermarkt-16x9-1.png)
![Diese Roboter sollen Solarparks viermal schneller bauen – mit ganz normalen Baumaschinen 8 [Bildinhalt mit KI erstellt] Roboterarm auf einem Kompaktlader positioniert ein Solarmodul auf einem großen Solarpark [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/gritt-solar-construction-robots-16x9-1.png)
![Roboter-Olympia 2026: Humanoide müssen jetzt kochen, putzen und Brände löschen 9 [Bildinhalt mit KI erstellt] Humanoide Roboter falten Wäsche und trainieren einen Feuerwehreinsatz in einer realitätsnahen Testarena [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/world-humanoid-robot-games-2026-16x9-1.png)
![WAIC 2026: Chinas Roboter beginnen zu arbeiten 10 [Bildinhalt mit KI erstellt] Humanoider Roboter, mobiler Manipulator und Vierbeinroboter demonstrieren Arbeitsaufgaben auf einer KI-Ausstellung [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/waic-2026-roboter-ausstellung-hero-16x9-1.png)
![Dieses Smartphone bewegt seine Kamera wie ein kleiner Roboter 12 [Bildinhalt mit KI erstellt] Konzept eines Smartphones mit kompaktem Gelenkarm, dessen Kamera eine Person auf der anderen Seite eines Tisches verfolgt [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/robot-phone-camera-arm-16x9-2.png)
![Dieser Roboter stoppt, bevor der Griff schiefgeht 13 [Bildinhalt mit KI erstellt] Industrieroboter vergleicht vor dem Kontakt mit einem Glas eine gefährliche Kollisionsbahn und eine sichere Greifbewegung [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/robot-precontact-foresight-16x9-2.png)
![KI-Wasserzeichen in Texten entfernen: verständliche Schritt-für-Schritt-Anleitung 14 [Bildinhalt mit KI erstellt] Illustration eines statistischen KI-Wasserzeichens in einem Textstrom, der von einem Menschen überarbeitet wird [Bildinhalt mit KI erstellt]](https://alpha-bionic.info/wp-content/uploads/2026/08/ki-wasserzeichen-text-statistische-markierung-16x9-1.png)