Autoren: Sören Gebbert*, Google Gemini 2.5 Pro
Datum: 2025-10-14
*Institut für holistische Technologieforschung GmbH
Einleitung 2
Abschnitt 1: Das neue Paradigma: Grundlegende KI-Technologien in der modernen Robotik 2
1.1 Die KI-getriebene Revolution in der Robotik 2
1.2 Eine Taxonomie der KI in der Robotik (IFR 2025 Framework) 3
1.3 Verkörperte KI: Die Konvergenz von Foundation Models und Robotik 4
Abschnitt 2: Vision-Language-Action (VLA) Modelle: Das Gehirn moderner Roboter 4
2.1 Einführung in Vision-Language-Action (VLA) Modelle 5
2.2 Hochmoderne proprietäre VLA-Systeme 5
2.2.1 Google DeepMinds Gemini Robotics: Eine duale Modellarchitektur für verkörpertes Schließen 5
2.2.2 Figure AIs Helix: Ein generalistisches VLA für die Steuerung von Humanoiden 6
2.2.3 NVIDIAs Projekt GR00T: Ein Foundation Model für generalistische Roboter 7
2.3 Führende Open-Source VLA-Innovationen 7
2.3.1 MolmoAct: Ein Action Reasoning Model (ARM) für erklärbare Steuerung 7
2.3.2 OpenVLA: Ein skalierbares Framework für die VLA-Entwicklung und -Feinabstimmung 8
Tabelle 1: Führende Vision-Language-Action Modelle (2025) 8
Abschnitt 3: Von der KI-Entscheidung zur physischen Bewegung: Die Steuerungspipeline 9
3.1 Lernparadigmen: Robotern beibringen, wie man handelt 10
3.2 Der Aufstieg generativer Policies: Diffusion für kontinuierliche Steuerung 10
3.3 Die Rolle der Wahrnehmung: KI-basiertes SLAM 11
Abschnitt 4: Das Robotik-Ökosystem: Kommerzielle und Open-Source-Plattformen 12
4.1 Führende kommerzielle Robotikunternehmen und -plattformen 12
4.2 Der Open-Source-Robotik-Stack: Werkzeuge für Entwicklung und Forschung 13
4.2.1 Middleware: Robot Operating System (ROS 2) 13
4.2.2 KI- und Machine-Learning-Bibliotheken 14
4.2.3 Simulationsplattformen 14
4.2.4 Manipulations- und Navigations-Frameworks 14
Tabelle 2: Wichtige Open-Source-Robotik-Projekte und -Plattformen (2025) 15
Abschnitt 5: Entwicklung und Einsatz benutzerdefinierter Roboter-KI: Ein praktischer Leitfaden 16
5.1 Training und Feinabstimmung eigener Modelle 16
5.2 Essentielle Entwicklungs- und Einsatzwerkzeuge 17
Fazit und Ausblick 18
Referenzen 19
Einleitung
Die Robotik befindet sich an einem entscheidenden Wendepunkt. Jüngste Durchbrüche bei großen KI-Modellen (Foundation Models) katalysieren einen Paradigmenwechsel von hochspezialisierter, aufgabenspezifischer Automatisierung hin zu verkörperter Intelligenz für allgemeine Zwecke.1 Dieser Wandel verspricht Roboter, die nicht mehr nur starren Routinen folgen, sondern ihre Umgebung wahrnehmen, verstehen und flexibel auf komplexe, unvorhergesehene Situationen reagieren können.
Dieser Bericht liefert eine umfassende technische Analyse der KI-Technologien, die moderne Robotersysteme Ende 2025 antreiben. Er untersucht die zentrale Rolle multimodaler Modelle, die Mechanismen zur Umwandlung von KI-Entscheidungen in physische Bewegung, das kommerzielle und Open-Source-Ökosystem sowie die praktischen Wege für die Entwicklung und den Einsatz eigener KI-gesteuerter Robotiklösungen. Ziel ist es, ein detailliertes und nuanciertes Bild des aktuellen Stands der Technik zu zeichnen, das sowohl für Forscher als auch für Entwickler und strategische Entscheidungsträger von Relevanz ist.
Abschnitt 1: Das neue Paradigma: Grundlegende KI-Technologien in der modernen Robotik
1.1 Die KI-getriebene Revolution in der Robotik
Die Robotiklandschaft hat sich fundamental gewandelt. Traditionelle Industrieroboter, die hinter Sicherheitskäfigen operieren und streng vordefinierte, repetitive Aufgaben ausführen, werden zunehmend durch eine neue Generation von KI-gesteuerten autonomen Systemen ergänzt und ersetzt. Diese modernen Roboter sind in der Lage, ohne ständige menschliche Kontrolle zu navigieren, sich an verändernde Bedingungen anzupassen und in Echtzeit Entscheidungen zu treffen.4
Mehrere Faktoren treiben diese Entwicklung voran. Zum einen besteht die Notwendigkeit, Variabilität und Unvorhersehbarkeit in dynamischen Umgebungen zu bewältigen, sei es in der „High-Mix/Low-Volume“-Produktion oder im öffentlichen Raum.5 Zum anderen beschleunigen soziodemografische Trends wie der Arbeitskräftemangel in Schlüsselindustrien wie der Logistik und dem Gesundheitswesen die Nachfrage nach intelligenter Automatisierung.1 Gleichzeitig zwingt der globale Wettbewerb Unternehmen dazu, durch eine höhere betriebliche Effizienz und nachhaltigere Produktionsprozesse wettbewerbsfähig zu bleiben.5 Die Integration von künstlicher Intelligenz (KI) und maschinellem Lernen (ML) ist der technologische Kern dieser Revolution und ermöglicht fortschrittliche Dateninterpretation, Echtzeit-Entscheidungsfindung und vorausschauende Wartung in Robotersystemen.6
1.2 Eine Taxonomie der KI in der Robotik (IFR 2025 Framework)
Die International Federation of Robotics (IFR) hat für 2025 ein konzeptionelles Framework vorgestellt, das die verschiedenen Rollen der KI in der Robotik systematisiert.5 Dieses Framework unterscheidet drei zentrale KI-Kategorien:
- Analytische KI: Diese Form der KI ermöglicht es Robotern, große Mengen an Sensordaten zu verarbeiten und zu analysieren, um ihre Abläufe zu optimieren. Ein typisches Beispiel sind Bildverarbeitungssysteme, die vergangene Greif- oder Montagevorgänge analysieren, um Muster zu erkennen und so ihre zukünftige Genauigkeit und Geschwindigkeit zu erhöhen.5 Analytische KI bildet die Grundlage für die Wahrnehmung und Zustandsschätzung des Roboters.
- Physische KI: Dieses Konzept beschreibt den Einsatz hochrealistischer Simulationen, in denen sich ein Roboter selbst trainiert und durch Erfahrung lernt, anstatt explizit programmiert zu werden. Die Entstehung der Physischen KI ist eine direkte und notwendige Reaktion auf eine der größten Hürden in der Robotik: den Mangel an großen, qualitativ hochwertigen Datensätzen von realen Roboteraktionen.7 Das Sammeln solcher Daten in der physischen Welt ist extrem zeitaufwendig, teuer und oft gefährlich. Hochleistungsfähige Simulationsumgebungen wie NVIDIA Isaac Sim ermöglichen es Entwicklern, Millionen von Trainingsbeispielen in einer virtuellen Welt zu generieren, was die Entwicklungskosten drastisch senkt und das Sim-to-Real-Problem (die Übertragung von in der Simulation Gelerntem auf die reale Welt) adressiert.5
- Generative KI: In der Robotik hat der Begriff „Generative KI“ eine doppelte Bedeutung, die für das Verständnis des modernen Technologie-Stacks entscheidend ist. Einerseits zielt die Branche darauf ab, einen „ChatGPT-Moment“ für die Physische KI zu schaffen.5 Hierbei geht es um die Erzeugung von übergeordneten, symbolischen Plänen. Ein großes Sprachmodell (LLM) könnte beispielsweise eine komplexe Anweisung wie „Räume die Küche auf“ in eine logische Abfolge von Teilaufgaben zerlegen.9 Andererseits werden generative Modelle, insbesondere sogenannte Diffusionsmodelle, auf einer viel niedrigeren Ebene eingesetzt: zur Erzeugung der kontinuierlichen, hochdimensionalen Bewegungsabläufe (Aktionen) selbst.11 Diese zweite Anwendung generiert nicht das „Was“ (den Plan), sondern das „Wie“ (die physische Ausführung). Diese Unterscheidung ist fundamental, da sie sich in den Architekturen moderner Robotersysteme widerspiegelt, die oft separate Komponenten für die übergeordnete Planung und die untergeordnete Motorsteuerung verwenden.
1.3 Verkörperte KI: Die Konvergenz von Foundation Models und Robotik
Das übergeordnete theoretische Konzept, das diese Entwicklungen vereint, ist die „Verkörperte KI“ (Embodied AI). Es beschreibt intelligente Systeme, die durch physische Interaktion mit ihrer Umgebung wahrnehmen, schlussfolgern und handeln.2 Anstatt die für die Robotik erforderliche Intelligenz von Grund auf neu zu entwickeln, konzentriert sich die Forschung nun darauf, das immense, in vortrainierten Foundation Models (wie LLMs und Vision-Language Models) vorhandene Wissen für die physische Welt nutzbar zu machen.14 Diese Modelle, trainiert auf riesigen Mengen von Text- und Bilddaten aus dem Internet, besitzen ein implizites Verständnis von Objekten, physikalischen Zusammenhängen und menschlicher Sprache. Die zentrale Herausforderung der modernen Robotik besteht darin, dieses Wissen zu „erden“ (to ground) und in zielgerichtete, physische Aktionen zu übersetzen, um so Schlüsselprobleme wie multimodale Sensorfusion, Entscheidungsfindung unter Unsicherheit und Aufgabengeneralisierung zu lösen.2
Abschnitt 2: Vision-Language-Action (VLA) Modelle: Das Gehirn moderner Roboter
2.1 Einführung in Vision-Language-Action (VLA) Modelle
Vision-Language-Action (VLA) Modelle sind eine Klasse multimodaler KI-Systeme, die als das operative Gehirn moderner Roboter fungieren. Sie sind darauf ausgelegt, Daten aus den Modalitäten Sehen (Vision), Sprache (Language) und Handlung (Action) zu einer einheitlichen, generalisierbaren Steuerungsrichtlinie (Policy) zu vereinen.3 Architektonisch bestehen sie typischerweise aus drei Kernkomponenten: einem visuellen Encoder (z. B. ein Convolutional Neural Network oder ein Vision Transformer), der Kamerabilder verarbeitet; einem großen Sprachmodell (LLM) als Backbone, das textuelle Anweisungen und das semantische Verständnis der Szene handhabt; und einem Aktions-Decoder, der die kombinierten Informationen in konkrete Motorbefehle für den Roboter umwandelt.16
Das zentrale Versprechen der VLAs liegt in ihrer Fähigkeit, das Skalierungsproblem der traditionellen Robotik zu lösen. Anstatt für jede neue Aufgabe einen immensen Programmieraufwand durch Experten zu erfordern, sollen VLAs es Robotern ermöglichen, neue Aufgaben mit minimalen oder gar keinen zusätzlichen, aufgabenspezifischen Daten zu erlernen, indem sie einfach Anweisungen in natürlicher Sprache befolgen.3
2.2 Hochmoderne proprietäre VLA-Systeme
2.2.1 Google DeepMinds Gemini Robotics: Eine duale Modellarchitektur für verkörpertes Schließen
Google DeepMind hat mit Gemini Robotics ein innovatives System vorgestellt, das auf einer zweigeteilten Architektur basiert. Diese Struktur ist ein klares Beispiel für die Entkopplung von übergeordnetem Denken und untergeordneter Ausführung.
- Architektur: Das System besteht aus zwei spezialisierten Modellen. Das Gemini Robotics-ER 1.5 Modell (ER für Embodied Reasoning) fungiert als übergeordnetes „Gehirn“. Es ist auf räumliches Verständnis, komplexe Aufgabenplanung und das Aufrufen externer Werkzeuge (z. B. Google Suche) spezialisiert.18 Dieses Modell erzeugt sprachliche Anweisungen für das zweite Modell, Gemini Robotics 1.5, ein VLA, das diese Anweisungen in präzise Motorbefehle für den Roboter umsetzt.18
- Funktionalität: Ein zentrales Konzept ist das „Denken vor dem Handeln“. Das VLA kann komplexe, lang andauernde Aufgaben autonom in kleinere, überschaubare Segmente zerlegen. Dies erhöht die Robustheit und die Fähigkeit zur Generalisierung auf neue Situationen erheblich.18
- Schlüsselfähigkeiten: Das System demonstriert eine bemerkenswerte Fähigkeit, Gelerntes über verschiedene Roboter-Embodiments hinweg zu übertragen – beispielsweise können Bewegungen, die auf einem zweiarmigen Roboter gelernt wurden, auf einen humanoiden Roboter übertragen werden. Zudem verfügt es über fortschrittliche fähigkeiten zum räumlich-zeitlichen Schließen.18 Entwickler können über die Gemini API in Google AI Studio auf das System zugreifen.18
2.2.2 Figure AIs Helix: Ein generalistisches VLA für die Steuerung von Humanoiden
Figure AI verfolgt mit seinem Helix-Modell einen ähnlichen architektonischen Ansatz für die Steuerung seiner humanoiden Roboter.
- Architektur: Das Helix-Modell nutzt eine „System 1, System 2“-Architektur. System 2 ist ein Vision-Language Model (VLM), das für das langsame, übergeordnete Verständnis von Szenen und Sprache zuständig ist. System 1 ist eine schnelle, reaktive visuomotorische Policy, die die Anweisungen von System 2 in Echtzeit (mit 200 Hz) in präzise Motorbefehle umsetzt.14
- Funktionalität: Helix zeichnet sich durch zwei besondere Fähigkeiten aus: Es ist das erste VLA, das eine hochfrequente, kontinuierliche Steuerung des gesamten oberen Körpers eines humanoiden Roboters (Handgelenke, Rumpf, Kopf und einzelne Finger) ausgibt. Darüber hinaus ermöglicht es die Zusammenarbeit von zwei Robotern an einer gemeinsamen Aufgabe, die durch natürliche Sprache koordiniert wird.14
- Schlüsselfähigkeiten: Ein einziges neuronales Netz lernt alle Verhaltensweisen ohne aufgabenspezifisches Fine-Tuning. Der Roboter kann Tausende von ihm unbekannten Haushaltsgegenständen aufnehmen, basierend auf abstrakten sprachlichen Anweisungen wie „nimm den Wüstengegenstand“.14
Das Auftauchen dieser dualen Architekturen bei führenden Unternehmen wie Google und Figure AI ist kein Zufall. Es stellt ein konvergentes Designmuster dar, das eine fundamentale technische Herausforderung löst: Große Sprachmodelle sind exzellente Denker und Planer, aber sie sind zu langsam für die Echtzeit-Motorsteuerung, die Frequenzen von über 100 Hz erfordert. Durch die Schaffung eines hierarchischen Systems, das ein langsames Planungsmodul mit einer schnellen, reaktiven Steuerungsebene kombiniert, wird es möglich, die semantische Tiefe großer KI-Modelle für die physische Robotik praktisch nutzbar zu machen.
2.2.3 NVIDIAs Projekt GR00T: Ein Foundation Model für generalistische Roboter
NVIDIA positioniert sich mit Projekt GR00T als Anbieter einer grundlegenden Plattform für humanoide Roboter.
- Architektur: GR00T N1 ist ein universelles Foundation Model, das darauf ausgelegt ist, menschliche Bewegungen durch Beobachtung zu verstehen und in Roboteraktionen zu übersetzen. Es wird oft mit einem diffusionsbasierten Aktions-Decoder kombiniert, um flüssige Bewegungen zu erzeugen.11
- Ökosystem-Integration: GR00T ist Teil einer umfassenden NVIDIA-Plattform, die die Simulationsumgebung Isaac Sim für das Training und das Jetson Thor System-on-a-Chip für den Einsatz auf dem Roboter umfasst. Dies zeigt eine durchgängige, vertikal integrierte Hard- und Softwarelösung.23
2.3 Führende Open-Source VLA-Innovationen
Während proprietäre Systeme auf integrierte Lösungen abzielen, konzentriert sich das Open-Source-Ökosystem auf Modularität, Anpassungsfähigkeit und Transparenz.
2.3.1 MolmoAct: Ein Action Reasoning Model (ARM) für erklärbare Steuerung
- Architektur: MolmoAct unterscheidet sich von reinen End-to-End-VLAs durch seine strukturierte, dreistufige Pipeline, die den Entscheidungsprozess explizit macht:
- Wahrnehmung: Das Modell kodiert Beobachtungen in tiefenbewusste Wahrnehmungs-Token, um ein 3D-Verständnis der Szene zu erlangen.
- Planung: Es generiert einen mittelfristigen räumlichen Plan in Form von editierbaren „visuellen Argumentationsspuren“ (Visual Reasoning Traces) – im Wesentlichen Wegpunkte im Bildraum.
- Steuerung: Basierend auf diesem visuellen Plan werden die untergeordneten Aktionen für den Roboter vorhergesagt.16
- Funktionalität: Diese strukturierte Argumentation macht das Verhalten des Roboters erklärbar und steuerbar. Der Benutzer kann die geplante Trajektorie als Überlagerung auf dem Kamerabild sehen und sie sogar durch Zeichnen auf einem Bildschirm korrigieren.16
- Open-Source-Beitrag: Die Entwickler haben die Modellgewichte, den Trainingscode und den MolmoAct-Datensatz veröffentlicht und etablieren es damit als offene Blaupause für die Entwicklung von erklärbaren Robotermodellen.16
2.3.2 OpenVLA: Ein skalierbares Framework für die VLA-Entwicklung und -Feinabstimmung
- Architektur: OpenVLA ist eine flexible, auf PyTorch basierende Codebasis, die für das Training und die Feinabstimmung von VLA-Modellen im Bereich von 1 bis 34 Milliarden Parametern konzipiert ist.17 Es baut auf Prismatic VLMs auf und verwendet bewährte Backbones wie Llama-2 sowie visuelle Encoder wie DINOv2 und SigLIP.17
- Funktionalität: Der Schwerpunkt von OpenVLA liegt auf Zugänglichkeit und Anpassungsfähigkeit. Es bietet integrierte Unterstützung für verschiedene Feinabstimmungsmethoden wie vollständiges Fine-Tuning und Low-Rank Adaptation (LoRA), was eine effiziente Anpassung an neue Roboter und Aufgaben ermöglicht.17
- Open-Source-Beitrag: Das Projekt stellt vortrainierte Modelle (z. B. openvla-7b), die auf dem umfangreichen Open X-Embodiment-Datensatz trainiert wurden, sowie Skripte für eine einfache Bereitstellung über eine REST-API zur Verfügung.17
Diese strategische Ausrichtung offenbart eine Divergenz auf dem Markt: Proprietäre Unternehmen bauen eng integrierte Hard- und Software-„Produkte“, die auf eine bestimmte Art von Roboter (oft Humanoide) zugeschnitten sind. Das Open-Source-Ökosystem hingegen schafft ein flexibles „Betriebssystem“ und Werkzeuge, die für eine breite Palette von Roboterhardware angepasst werden können, was die Innovation auf breiter Front fördert.
Tabelle 1: Führende Vision-Language-Action Modelle (2025)
Modell | Hauptentwickler | Open Source | Architektur | Basis-Foundation-Modelle (LLM/Vision) | Hauptunterscheidungsmerkmal |
Gemini Robotics | Google DeepMind | Nein | Dual-Modell: Embodied Reasoning (ER) + VLA | Gemini-Familie | „Denken vor dem Handeln“; Lernen über verschiedene Embodiments hinweg |
Figure Helix | Figure AI | Nein | Dual-Modell: System 2 (langsames Denken) + System 1 (schnelle Steuerung) | Proprietäres VLM | Steuerung des gesamten humanoiden Oberkörpers; Multi-Roboter-Kollaboration |
NVIDIA GR00T N1 | NVIDIA | Nein | Generalistisches Foundation Model + Diffusions-Decoder | Proprietär | Teil eines integrierten Hard-/Software-Ökosystems (Isaac Sim, Jetson) |
MolmoAct | Allen Institute for AI et al. | Ja | Dreistufige Pipeline: Wahrnehmung, Planung, Steuerung | Molmo (basierend auf OLMo) | Erklärbarkeit und Steuerbarkeit durch „Visual Reasoning Traces“ |
OpenVLA | OpenVLA-Team | Ja | Skalierbares VLA-Framework | Llama-2, Vicuña / DINOv2, SigLIP | Fokus auf einfache Feinabstimmung (LoRA) und Anpassung an neue Roboter |
Abschnitt 3: Von der KI-Entscheidung zur physischen Bewegung: Die Steuerungspipeline
Die Umwandlung einer von einem VLA-Modell getroffenen abstrakten Entscheidung in eine präzise, flüssige und erfolgreiche physische Bewegung ist eine der größten technischen Herausforderungen in der Robotik. Dieser Prozess, die sogenannte Steuerungspipeline, stützt sich auf spezifische Lernparadigmen und fortschrittliche Aktionsgenerierungsmodelle.
3.1 Lernparadigmen: Robotern beibringen, wie man handelt
Moderne Robotersysteme werden durch eine Kombination verschiedener Lernansätze trainiert, die jeweils spezifische Stärken und Schwächen aufweisen.
- Imitationslernen (IL) & Verhaltensklonierung (BC): Imitationslernen ist ein Paradigma, bei dem ein Roboter Fähigkeiten durch die Beobachtung von Expertendemonstrationen erwirbt.10 Die einfachste Form ist die Verhaltensklonierung (Behavioral Cloning), bei der eine Policy eine direkte Abbildung von Beobachtungen zu Aktionen () aus einem Datensatz von Expertentrajektorien lernt.11 Die Hauptvorteile dieses Ansatzes sind seine Dateneffizienz und Sicherheit, da der Roboter nicht durch potenziell gefährliches Ausprobieren lernen muss.27 Die größte Schwäche ist der sogenannte „Distributional Shift“: Wenn der Roboter in eine Situation gerät, die in den Demonstrationsdaten nicht vorkam, weiß er möglicherweise nicht, wie er reagieren soll, was zu Fehlern führt.
- Bestärkendes Lernen (RL): Beim bestärkenden Lernen (Reinforcement Learning) lernt ein Agent optimales Verhalten durch Versuch und Irrtum, indem er versucht, ein kumulatives Belohnungssignal zu maximieren.11 Der Hauptvorteil von RL ist die Fähigkeit, Verhaltensweisen zu entdecken, die besser sind als die des menschlichen Experten. Die Herausforderungen liegen jedoch in der geringen Stichprobeneffizienz (es sind oft Millionen von Versuchen erforderlich) und der Schwierigkeit, eine geeignete Belohnungsfunktion zu entwerfen, die das gewünschte Verhalten präzise beschreibt.30
- Synergistische Ansätze: In der Praxis werden diese Methoden oft kombiniert. Ein gängiger Ansatz ist es, eine Policy zunächst mittels Imitationslernen auf Expertendaten vorzutrainieren, um eine gute Ausgangsbasis zu schaffen. Anschließend wird diese Policy durch bestärkendes Lernen weiter verfeinert, um ihre Leistung und Robustheit gegenüber unvorhergesehenen Situationen zu verbessern.31
3.2 Der Aufstieg generativer Policies: Diffusion für kontinuierliche Steuerung
Traditionelle Ansätze wie die direkte Regression von Aktionen stoßen bei komplexen Manipulationsaufgaben an ihre Grenzen. Viele reale Aufgaben sind multimodal, d. h. es gibt mehrere, gleichermaßen korrekte Wege, sie zu lösen (z. B. kann eine Tasse von links oder rechts gegriffen werden). Ein Regressionsmodell, das versucht, all diese Möglichkeiten zu mitteln, erzeugt oft zögerliche oder physikalisch unsinnige Bewegungen.12
Hier haben sich Diffusions-Policies als bahnbrechende Lösung erwiesen. Anstatt eine deterministische Aktion vorherzusagen, formulieren sie die Aktionserzeugung als einen bedingten Entrauschungsprozess.7 Die Policy lernt, einen zufälligen Rauschvektor, bedingt durch die aktuelle Beobachtung des Roboters (z. B. ein Kamerabild), schrittweise in eine kohärente, hochdimensionale Aktionssequenz zu verfeinern.12 Dieser Ansatz ist nicht nur eine technische Verbesserung, sondern ein Paradigmenwechsel von einer deterministischen zu einer probabilistischen Steuerung. Die Policy lernt nicht mehr „die eine richtige Aktion“, sondern die gesamte Verteilung aller möglichen guten Aktionen. Zur Ausführungszeit wählt sie eine kohärente Lösung aus dieser Verteilung aus, was zu deutlich flüssigeren und robusteren Verhaltensweisen führt.
Diffusions-Policies bieten mehrere entscheidende Vorteile:
- Handhabung von Multimodalität: Sie können auf natürliche Weise Aufgaben modellieren, bei denen mehrere unterschiedliche Bewegungsabläufe zum Erfolg führen.12
- Zeitliche Konsistenz: Durch die Vorhersage einer kurzen Sequenz zukünftiger Aktionen („Action Chunking“) erzeugen sie glattere und zielgerichtetere Bewegungen als Modelle, die nur einen einzigen Zeitschritt vorhersagen.12
- Stabiles Training: Sie vermeiden die instabile Trainingsdynamik, die oft mit anderen generativen Modellen wie GANs verbunden ist.12
Diese Technik wird oft mit einer „Receding Horizon Control“ kombiniert. Dabei plant die Policy eine kurze Aktionssequenz, führt aber nur den ersten Schritt aus. Dann nimmt sie eine neue Beobachtung auf und plant erneut. Dies stellt einen eleganten Kompromiss zwischen der Notwendigkeit einer vorausschauenden Planung für flüssige Bewegungen und der Fähigkeit zur sofortigen Reaktion auf eine dynamische Umgebung dar.12
3.3 Die Rolle der Wahrnehmung: KI-basiertes SLAM
Während VLAs Wahrnehmung oft End-to-End durchführen, benötigen viele mobile Roboter, insbesondere in der Logistik und im Außeneinsatz, weiterhin eine explizite Zustandsschätzung. Hier spielt Simultaneous Localization and Mapping (SLAM) eine entscheidende Rolle. KI- und Deep-Learning-Methoden revolutionieren auch diesen Bereich. Anstatt sich auf handgefertigte Merkmale zu verlassen, verwenden moderne SLAM-Systeme neuronale Netze (insbesondere CNNs) zur robusteren Merkmalsextraktion aus Kamerabildern oder LiDAR-Daten. Transformer-Architekturen verbessern das räumliche Schließen und die Vorhersage von Bewegungen, während semantisches SLAM es dem Roboter ermöglicht, die Umgebung nicht nur geometrisch, sondern auch konzeptuell zu verstehen (z. B. zu erkennen, dass ein bestimmter Bereich ein „Tisch“ oder eine „Tür“ ist).35 Eine präzise und robuste Lokalisierung ist eine grundlegende Voraussetzung für jede nachfolgende KI-basierte Entscheidungsfindung. Der prognostizierte starke Anstieg des Marktes für SLAM-Robotik unterstreicht seine anhaltende Bedeutung.37
Abschnitt 4: Das Robotik-Ökosystem: Kommerzielle und Open-Source-Plattformen
Das Ökosystem der Robotik im Jahr 2025 ist durch eine dynamische Koexistenz von etablierten Industrieunternehmen, agilen KI-Start-ups und einer robusten Open-Source-Community gekennzeichnet. Diese Akteure verfolgen unterschiedliche Geschäftsmodelle, die den Markt prägen.
4.1 Führende kommerzielle Robotikunternehmen und -plattformen
Der Markt lässt sich grob in zwei Kategorien einteilen: traditionelle Anbieter von Industrieautomation und eine neue Welle von KI-nativen Innovatoren.
- Führer der Industrieautomation:
- ABB Robotics: ABB ist bekannt für sein breites Portfolio an Robotern für diverse Fertigungsanwendungen (SCARA, Delta, Gelenkarmroboter). Die KI-Strategie des Unternehmens konzentriert sich auf die Integration von ML und Computer Vision in bestehende Systeme, oft gefördert durch Initiativen wie KI-Startup-Wettbewerbe, um die eigenen Plattformen mit externer Innovation anzureichern.38
- FANUC Robotics: Als dominierender Akteur in der Industrieautomation, insbesondere in der Automobil- und Elektronikfertigung, verfolgt FANUC eine Strategie der schrittweisen KI-Integration. Dies umfasst die Ausstattung seiner Roboter mit fortschrittlichen Bildverarbeitungssystemen und Kraftsensoren sowie strategische Partnerschaften mit KI-Start-ups wie Inbolt, um hochspezialisierte Fähigkeiten wie die Präzisionsarbeit an sich bewegenden Montagelinien zu ermöglichen.38
- KUKA Robotics: KUKA bietet schlüsselfertige Automatisierungslösungen an und integriert bildgesteuerte Robotik in komplette Produktionslinien, insbesondere für die Automobilindustrie.4
- KI-native und fortschrittliche Robotik-Innovatoren:
- Boston Dynamics: Berühmt für seine hochentwickelten mobilen Roboter wie den vierbeinigen Spot und den humanoiden Atlas. Das Unternehmen demonstriert die Grenzen des Möglichen in der KI-gesteuerten Fortbewegung, Navigation und Geschicklichkeit in komplexen, unstrukturierten Umgebungen.38
- Standard Bots: Ein in den USA ansässiger Hersteller von KI-gesteuerten kollaborativen Robotern (Cobots). Ihr Modell RO1 verfügt über integrierte 3D-Sicht und eine No-Code-Programmieroberfläche, mit dem Ziel, KI-Automatisierung auch für kleine und mittlere Unternehmen zugänglich zu machen.4
- Humanoide Roboterfirmen: Unternehmen wie Sanctuary AI und Agility Robotics gewinnen an Bedeutung. Sie entwickeln humanoide Roboter, die speziell für den Einsatz in der Industrie und Logistik konzipiert sind und menschliche Arbeitsumgebungen ohne größere Umbauten nutzen sollen.38
Diese Marktstruktur offenbart eine klare Bifurkation in den Geschäftsmodellen. Unternehmen wie Boston Dynamics oder Figure AI verfolgen ein vertikal integriertes Modell, bei dem sie ein komplettes „Roboter-als-Produkt“ anbieten, bei dem Hardware und KI eng miteinander verknüpft sind. Im Gegensatz dazu agieren Unternehmen wie NVIDIA und die Open-Source-Community als horizontal integrierte „Plattform- und Werkzeuganbieter“. Sie liefern die „Schaufeln und Spitzhacken“ für den Goldrausch in der Robotik – die Simulationsumgebungen, KI-Modelle und Middleware, die von anderen Unternehmen zur Entwicklung ihrer eigenen Roboter genutzt werden.
4.2 Der Open-Source-Robotik-Stack: Werkzeuge für Entwicklung und Forschung
Die Open-Source-Community bildet das Rückgrat der Forschung und Entwicklung in der Robotik. Ein reichhaltiges Ökosystem an Werkzeugen ermöglicht es Forschern und Unternehmen, auf bewährten Komponenten aufzubauen.
4.2.1 Middleware: Robot Operating System (ROS 2)
ROS 2 ist das De-facto-Standard-Middleware-Framework für die Robotik. Es bietet eine flexible, modulare Architektur für die Kommunikation zwischen den verschiedenen Softwarekomponenten eines Roboters, von Sensortreibern über Wahrnehmungsalgorithmen bis hin zur Bewegungsplanung. Seine Echtzeitfähigkeit und plattformübergreifende Unterstützung machen es zur idealen Grundlage für moderne KI-Anwendungen.41
4.2.2 KI- und Machine-Learning-Bibliotheken
- Hugging Face LeRobot: Diese auf PyTorch basierende Bibliothek zielt darauf ab, den Einstieg in die praxisnahe Robotik zu erleichtern. Sie stellt vortrainierte Modelle, Datensätze und Werkzeuge zur Verfügung, mit einem klaren Fokus auf Imitations- und bestärkendes Lernen.23
- OpenVLA & MolmoAct: Wie in Abschnitt 2 beschrieben, dienen diese Projekte als offene Referenzimplementierungen und Frameworks für die Entwicklung und Anpassung von VLA-Modellen.16
4.2.3 Simulationsplattformen
- NVIDIA Isaac Sim: Eine hochrealistische, fotorealistische Simulationsplattform, die auf der Omniverse-Engine aufbaut. Sie ist speziell für das Training und Testen von KI-Modellen konzipiert und bietet Funktionen wie die Generierung synthetischer Daten, fortschrittliche Sensorsimulation und eine enge Integration mit ROS 2.23
- Gazebo: Ein langjähriger und leistungsfähiger Simulator in der ROS-Community, der weithin zum Testen von Navigations- und Steuerungsalgorithmen verwendet wird.42
4.2.4 Manipulations- und Navigations-Frameworks
- MoveIt: Das populärste Open-Source-Framework für die Robotermanipulation. Es bietet eine umfassende Bibliothek für Bewegungsplanung, Kinematik, Kollisionsprüfung und mehr. Das von PickNik Robotics gepflegte Projekt folgt einem „Open-Core“-Modell mit einer kostenlosen Basisversion und einer kommerziellen „Pro“-Version.23
- Nav2 Stack: Der offizielle Navigationsstack für ROS 2. Er bietet ein modulares Framework für Lokalisierung, Pfadplanung und Hindernisvermeidung für mobile Roboter.44
Die zunehmende Bedeutung von Software und KI führt auch dazu, dass sich die Definition eines „Robotikunternehmens“ auflöst. Große Technologiekonzerne wie Microsoft (Azure AI), Google (Robotics AI Platform) und Amazon (AWS RoboMaker) sind zu zentralen Akteuren im Ökosystem geworden. Sie stellen die Cloud-Infrastruktur, Simulationsdienste und grundlegenden KI-Modelle bereit, die für die Entwicklung moderner Roboter unerlässlich sind.41 Robotik ist nicht mehr nur ein mechanisches Problem, sondern in erster Linie ein Software- und Datenproblem, was diese Technologiegiganten zu unverzichtbaren Partnern in der Branche macht.
Tabelle 2: Wichtige Open-Source-Robotik-Projekte und -Plattformen (2025)
Projektname | Kategorie | Hauptverantwortliche(r) | Primäre Funktion/Zweck | Lizenz |
ROS 2 | Middleware | Open Robotics / Intrinsic | Kommunikationsframework und Werkzeugsatz für Roboter-Software | Apache 2.0 |
Gazebo | Simulator | Open Robotics / Intrinsic | Physikbasierter 3D-Simulator für Robotik | Apache 2.0 |
NVIDIA Isaac Sim | Simulator | NVIDIA | Fotorealistischer Simulator für KI-Training und synthetische Datengenerierung | Proprietär (kostenlos) |
LeRobot | KI-Bibliothek | Hugging Face | PyTorch-Bibliothek für Imitations- und bestärkendes Lernen | Apache 2.0 |
OpenVLA | KI-Framework | OpenVLA-Team | Framework zum Trainieren und Feinabstimmen von VLA-Modellen | MIT / Llama License |
MolmoAct | KI-Modell | Allen Institute for AI et al. | Open-Source Action Reasoning Model für erklärbare Steuerung | Apache 2.0 |
MoveIt | Manipulation | PickNik Robotics | Framework für Bewegungsplanung und Manipulation | BSD 3-Clause |
Nav2 Stack | Navigation | Open Navigation | Vollständiger Navigationsstack für mobile Roboter in ROS 2 | Apache 2.0 |
OpenCV | Computer Vision | OpenCV.org | Umfassende Bibliothek für Bildverarbeitungsalgorithmen | Apache 2.0 |
Abschnitt 5: Entwicklung und Einsatz benutzerdefinierter Roboter-KI: Ein praktischer Leitfaden
Für Anwender, die eigene KI-gesteuerte Robotersysteme entwickeln oder anpassen möchten, hat sich der Entwicklungsprozess grundlegend verändert. Er ist nicht mehr primär code-zentriert, sondern daten-zentriert.
5.1 Training und Feinabstimmung eigener Modelle
Der entscheidende Engpass bei der Entwicklung von Roboter-KI bleibt die Verfügbarkeit von qualitativ hochwertigen, umfangreichen Datensätzen von Roboteraktionen.7
- Nutzung großer Datensätze: Öffentliche Datensätze wie Open X-Embodiment sind von unschätzbarem Wert. Sie aggregieren Daten von Hunderten verschiedener Robotertypen und -aufgaben und bilden die Grundlage für das Training von generalistischen Modellen wie OpenVLA.17
- Entscheidung: Neu trainieren vs. anpassen: Das Training eines großen VLA-Modells von Grund auf ist für die meisten Organisationen rechentechnisch und finanziell nicht machbar.7 Der weitaus praktischere Ansatz ist die Feinabstimmung (Fine-Tuning) eines bereits vortrainierten Open-Source-Modells.
- Feinabstimmungstechniken: Mit parameter-effizienten Feinabstimmungsmethoden (PEFT) wie LoRA (Low-Rank Adaptation) können vortrainierte Modelle wie OpenVLA effizient an neue Aufgaben oder eine neue Roboterhardware angepasst werden, ohne das gesamte Modell neu trainieren zu müssen.17 Optimierte Rezepte wie OFT (Optimized Fine-Tuning) für OpenVLA können zudem die Inferenzgeschwindigkeit der angepassten Modelle drastisch erhöhen.17
- Strategien zur Datengenerierung:
- Simulation: Der Einsatz von hochrealistischen Simulatoren wie NVIDIA Isaac Sim ist die wichtigste Strategie, um den Datenmangel zu überwinden. Durch Techniken wie Domain Randomization (systematisches Variieren von Beleuchtung, Texturen, Objektpositionen etc.) kann die Lücke zwischen Simulation und Realität (Sim-to-Real Gap) verringert werden, wodurch die in der Simulation trainierten Modelle robuster in der realen Welt agieren.8
- Generative Modelle: Ein aufkommender Ansatz ist die Nutzung von generativer KI selbst, um neue Trainingsszenarien zu synthetisieren oder bestehende Datensätze zu erweitern, was die Datenknappheit weiter mildert.8
Der Arbeitsablauf eines modernen Robotik-Ingenieurs verlagert sich somit weg vom Schreiben komplexer Steuerungsalgorithmen hin zu Aufgaben, die denen eines Datenwissenschaftlers ähneln: Sammeln von Demonstrationen, Kuratieren von Datensätzen, Aufbau von Simulationsumgebungen und Management von Trainings- und Feinabstimmungspipelines.
5.2 Essentielle Entwicklungs- und Einsatzwerkzeuge
Dank des ausgereiften Open-Source-Ökosystems ist es heute erstmals möglich, eine vollständige, hochmoderne Toolchain für die Entwicklung von Roboter-KI zusammenzustellen, was den Zugang zu dieser Technologie demokratisiert.
- Simulationsumgebungen:
- NVIDIA Isaac Sim gilt als das führende Werkzeug für KI-zentrierte Robotikentwicklung, das Fotorealismus, präzise Physik und eine nahtlose Integration mit KI-Frameworks und ROS 2 bietet.41
- Gazebo und CoppeliaSim sind robuste und weit verbreitete Open-Source-Alternativen, die sich hervorragend für allgemeine Robotiksimulation und Algorithmustests eignen.42
- Hardware für den Edge-Einsatz:
- Die NVIDIA Jetson Plattform ist eine Reihe von kleinen, leistungsstarken Computern, die speziell dafür entwickelt wurden, komplexe neuronale Netze in Echtzeit direkt auf dem Roboter („at the edge“) auszuführen.44
- NVIDIA stellt ROS 2-Pakete zur Verfügung, die die einfache Nutzung von Frameworks wie PyTorch und TensorFlow auf Jetson-Hardware ermöglichen, zusammen mit Optimierungswerkzeugen wie TensorRT zur Beschleunigung der Inferenz.44
- Open-Source-Plattformen für Experimente:
Für einen Anwender, der „Roboter-KI ausprobieren“ möchte, empfiehlt sich eine konkrete Kombination von Open-Source-Werkzeugen:
- ROS 2 als grundlegende Middleware-Architektur.41
- Gazebo (für den Einstieg) oder Isaac Sim (für fortgeschrittene KI) als Simulationsumgebung.44
- LeRobot oder OpenVLA, um mit vortrainierten Policies und Datensätzen zu experimentieren und die Grundlagen des Imitationslernens zu erlernen.17
- Für den Übergang zur realen Welt bieten sich zugängliche Open-Source-Hardwareplattformen wie der TurtleBot für Navigationsaufgaben oder Roboterarme von Herstellern wie Evezor an, die mit Frameworks wie MoveIt kompatibel sind.23
Die Verfügbarkeit und Reife dieser Komponenten bedeutet, dass einzelne Forscher oder kleine Start-ups heute Zugang zu derselben Klasse von Werkzeugen haben, die früher nur großen Forschungs- und Entwicklungslabors von Unternehmen zur Verfügung standen. Dies beschleunigt das Innovationstempo in der gesamten Branche erheblich.
Fazit und Ausblick
Die Robotik des Jahres 2025 wird von der tiefen Integration fortschrittlicher KI-Technologien geprägt. Die Analyse zeigt mehrere klare Trends:
- Dominanz multimodaler Modelle: Vision-Language-Action (VLA) Modelle sind zum Standard für die Steuerung intelligenter Roboter geworden und ermöglichen eine intuitive Interaktion über natürliche Sprache.
- Architektonische Konvergenz: Führende Systeme setzen auf eine entkoppelte Architektur, die hochrangiges, langsames Schließen von schneller, reaktiver Motorsteuerung trennt. Dies ist ein entscheidender technischer Kompromiss, um die Leistungsfähigkeit großer KI-Modelle in der physischen Welt nutzbar zu machen.
- Aufstieg generativer Policies: Diffusionsmodelle haben sich als überlegene Methode zur Erzeugung flüssiger, robuster und multimodaler Bewegungen für komplexe Manipulationsaufgaben etabliert.
- Ein duales Ökosystem: Der Markt wird sowohl von proprietären, vertikal integrierten Systemen als auch von einem dynamischen, horizontalen Open-Source-Ökosystem geprägt, das die Entwicklung demokratisiert und Innovationen vorantreibt.
Trotz dieser enormen Fortschritte bleiben zentrale Herausforderungen bestehen. Der Engpass bei realen Aktionsdaten ist nach wie vor die größte Hürde.7 Die Verbesserung der Übertragbarkeit von der Simulation auf die Realität (Sim-to-Real) 8, die Gewährleistung von Sicherheit und Erklärbarkeit 9 sowie das Erreichen einer echten Generalisierung über verschiedene Roboter-Embodiments hinweg 2 sind die Hauptforschungsfelder für die kommenden Jahre.
Die Verschmelzung von groß angelegter KI mit der Robotik hat einen unumkehrbaren Weg in Richtung universell einsetzbarer Roboter eingeschlagen. Die hier vorgestellten Technologien und Plattformen sind die Bausteine, aus denen die nächste Generation autonomer Systeme konstruiert wird, die das Potenzial haben, Industrie, Dienstleistungen und unseren Alltag grundlegend zu verändern.
Referenzen
- International Federation of Robotics, Zugriff am Oktober 14, 2025, https://ifr.org/
- [2505.20503] Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2505.20503
- [2510.07077] Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2510.07077
- The future of robotics: 7 predictions shaping 2025 and beyond - Standard Bots, Zugriff am Oktober 14, 2025, https://standardbots.com/blog/future-of-robotics-predictions
- TOP 5 Global Robotics Trends 2025 - International Federation of ..., Zugriff am Oktober 14, 2025, https://ifr.org/ifr-press-releases/news/top-5-global-robotics-trends-2025
- Robotic Trends in 2025: Innovations Transforming Industries | Robotnik ®, Zugriff am Oktober 14, 2025, https://robotnik.eu/robotic-trends-in-2025-innovations-transforming-industries/
- RoboBERT: An End-to-end Multimodal Robotic Manipulation Model - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2502.07837v1
- Generative Artificial Intelligence in Robotic Manipulation: A Survey - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2503.03464v1
- [2408.07806] From Decision to Action in Surgical Autonomy: Multi-Modal Large Language Models for Robot-Assisted Blood Suction - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2408.07806
- Language-Conditioned Imitation Learning for Robot Manipulation Tasks, Zugriff am Oktober 14, 2025, https://proceedings.neurips.cc/paper/2020/file/9909794d52985cbc5d95c26e31125d1a-Paper.pdf
- Vision Language Action Models (VLA) & Policies for Robots, Zugriff am Oktober 14, 2025, https://learnopencv.com/vision-language-action-models-lerobot-policy/
- Diffusion Policy: - Robotics, Zugriff am Oktober 14, 2025, https://www.roboticsproceedings.org/rss19/p026.pdf
- [Literature Review] Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges - Moonlight, Zugriff am Oktober 14, 2025, https://www.themoonlight.io/en/review/robotic-manipulation-via-imitation-learning-taxonomy-evolution-benchmark-and-challenges
- Helix: A Vision-Language-Action Model for Generalist Humanoid ..., Zugriff am Oktober 14, 2025, https://www.figure.ai/news/helix
- MolmoAct: Action Reasoning Models that can Reason in Space - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/394439828_MolmoAct_Action_Reasoning_Models_that_can_Reason_in_Space
- MolmoAct: Action Reasoning Models that can Reason in Space - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2508.07917v1
- openvla/openvla: OpenVLA: An open-source vision ... - GitHub, Zugriff am Oktober 14, 2025, https://github.com/openvla/openvla
- Gemini Robotics 1.5 brings AI agents into the physical world - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
- Building the Next Generation of Physical Agents with Gemini Robotics-ER 1.5, Zugriff am Oktober 14, 2025, https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/
- Gemini Robotics 1.5 - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/models/gemini-robotics/gemini-robotics/
- Responsibly advancing AI and robotics - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/models/gemini-robotics/responsibly-advancing-ai-and-robotics/
- Gemini Robotics-ER 1.5 | Gemini API | Google AI for Developers, Zugriff am Oktober 14, 2025, https://ai.google.dev/gemini-api/docs/robotics-overview
- The Most Promising Open Source Robotics Startups in 2025 ..., Zugriff am Oktober 14, 2025, https://www.hackster.io/news/the-most-promising-open-source-robotics-startups-in-2025-c576072e1e07
- MolmoAct: An Action Reasoning Model that reasons in 3D space - Ai2, Zugriff am Oktober 14, 2025, https://allenai.org/blog/molmoact
- MolmoAct: Action Reasoning Models that can Reason in Space - Hugging Face, Zugriff am Oktober 14, 2025, https://huggingface.co/papers/2508.07917
- Coarse-to-Fine Imitation Learning: Robot Manipulation from a Single Demonstration, Zugriff am Oktober 14, 2025, https://www.robot-learning.uk/coarse-to-fine-imitation-learning
- Why use imitation learning for robotic arm manipulation, and what are the issues when starting from 3D reconstruction? | ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/post/Why_use_imitation_learning_for_robotic_arm_manipulation_and_what_are_the_issues_when_starting_from_3D_reconstruction
- AI-Driven Control Strategies for Biomimetic Robotics: Trends, Challenges, and Future Directions - MDPI, Zugriff am Oktober 14, 2025, https://www.mdpi.com/2313-7673/10/7/460
- (PDF) AI Motion Control – A Generic Approach to Develop Control Policies for Robotic Manipulation Tasks - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/334712774_AI_Motion_Control_-_A_Generic_Approach_to_Develop_Control_Policies_for_Robotic_Manipulation_Tasks
- Learning for a Robot: Deep Reinforcement Learning, Imitation Learning, Transfer Learning - MDPI, Zugriff am Oktober 14, 2025, https://www.mdpi.com/1424-8220/21/4/1278
- Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2505.12744
- Diffusion Policy Policy Optimization, Zugriff am Oktober 14, 2025, https://diffusion-ppo.github.io/
- Diffusion Policy, Zugriff am Oktober 14, 2025, https://diffusion-policy.cs.columbia.edu/
- Reactive Diffusion Policy - Robotics, Zugriff am Oktober 14, 2025, https://www.roboticsproceedings.org/rss21/p052.pdf
- (PDF) Mastering SLAM: Techniques, Algorithms, and Applications in Artificial Intelligence and Autonomous Systems - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/395070043_Mastering_SLAM_Techniques_Algorithms_and_Applications_in_Artificial_Intelligence_and_Autonomous_Systems
- (PDF) Advances in AI-Driven SLAM: Recent Breakthroughs and Future Directions for Robust Autonomous Navigation in GPS-Denied Environments - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/389785093_Advances_in_AI-Driven_SLAM_Recent_Breakthroughs_and_Future_Directions_for_Robust_Autonomous_Navigation_in_GPS-Denied_Environments
- SLAM Robotics Analysis 2025 and Forecasts 2033: Unveiling Growth Opportunities, Zugriff am Oktober 14, 2025, https://www.archivemarketresearch.com/reports/slam-robotics-472104
- Top AI robotics companies to watch in 2025 (and what they're ..., Zugriff am Oktober 14, 2025, https://standardbots.com/blog/ai-robotics-companies
- Top 7 Robotics Companies (2025): Revolutionizing Automation - eWeek, Zugriff am Oktober 14, 2025, https://www.eweek.com/artificial-intelligence/robotics-companies/
- 34 Robotics Companies & Startups to Know in 2025 | Built In, Zugriff am Oktober 14, 2025, https://builtin.com/robotics/robotics-companies-roundup
- Top 10 AI Robotics Platforms Tools in 2025: Features, Pros, Cons ..., Zugriff am Oktober 14, 2025, https://www.devopsschool.com/blog/top-10-ai-robotics-platforms-tools-in-2025-features-pros-cons-comparison/
- Top 20 open-source robotics projects and initiatives for robotics research - RoboticsBiz, Zugriff am Oktober 14, 2025, https://roboticsbiz.com/top-20-open-source-robotics-projects-and-initiatives-for-robotics-research/ (Internet-Archive-Snapshot vom 16.07.2025)
- huggingface/lerobot: LeRobot: Making AI for Robotics more ... - GitHub, Zugriff am Oktober 14, 2025, https://github.com/huggingface/lerobot
- Top AI Tools for ROS 2 Robotics Projects (2024 Guide) - Arsturn, Zugriff am Oktober 14, 2025, https://www.arsturn.com/blog/the-ultimate-guide-to-ai-tools-for-ros-2-projects
- Top AI Platforms to Drive Business Growth in 2025 - Curotec, Zugriff am Oktober 14, 2025, https://www.curotec.com/insights/leading-ai-platforms/