Historisches Artikelarchiv

Der Stand der KI in der Robotik: Eine tiefgehende Analyse multimodaler Intelligenz, Steuerungs-Paradigmen und des Ökosystems 2025

Archivierter Beitrag von Sören Gebbert und Google Gemini 2.5 Pro.

Originalstand 14. Oktober 2025HTML-Export redaktionell bereinigthistorische Archivfassung
Hinweis zur Archivfassung

Diese Fassung gibt den Beitrag in seinem damaligen inhaltlichen Stand wieder. Aussagen, Quellen, Softwarestände, Modellbezeichnungen und Lizenzbegriffe entsprechen dem Veröffentlichungsdatum. Das Layout wurde für das heutige Archiv aufbereitet; unsichere Einbettungen und eine Abbildung mit ungeklärten Drittrechten wurden entfernt.

Autoren:        Sören Gebbert*, Google Gemini 2.5 Pro

Datum:        2025-10-14

*Institut für holistische Technologieforschung GmbH

Einleitung        2

Abschnitt 1: Das neue Paradigma: Grundlegende KI-Technologien in der modernen Robotik        2

1.1 Die KI-getriebene Revolution in der Robotik        2

1.2 Eine Taxonomie der KI in der Robotik (IFR 2025 Framework)        3

1.3 Verkörperte KI: Die Konvergenz von Foundation Models und Robotik        4

Abschnitt 2: Vision-Language-Action (VLA) Modelle: Das Gehirn moderner Roboter        4

2.1 Einführung in Vision-Language-Action (VLA) Modelle        5

2.2 Hochmoderne proprietäre VLA-Systeme        5

2.2.1 Google DeepMinds Gemini Robotics: Eine duale Modellarchitektur für verkörpertes Schließen        5

2.2.2 Figure AIs Helix: Ein generalistisches VLA für die Steuerung von Humanoiden        6

2.2.3 NVIDIAs Projekt GR00T: Ein Foundation Model für generalistische Roboter        7

2.3 Führende Open-Source VLA-Innovationen        7

2.3.1 MolmoAct: Ein Action Reasoning Model (ARM) für erklärbare Steuerung        7

2.3.2 OpenVLA: Ein skalierbares Framework für die VLA-Entwicklung und -Feinabstimmung        8

Tabelle 1: Führende Vision-Language-Action Modelle (2025)        8

Abschnitt 3: Von der KI-Entscheidung zur physischen Bewegung: Die Steuerungspipeline        9

3.1 Lernparadigmen: Robotern beibringen, wie man handelt        10

3.2 Der Aufstieg generativer Policies: Diffusion für kontinuierliche Steuerung        10

3.3 Die Rolle der Wahrnehmung: KI-basiertes SLAM        11

Abschnitt 4: Das Robotik-Ökosystem: Kommerzielle und Open-Source-Plattformen        12

4.1 Führende kommerzielle Robotikunternehmen und -plattformen        12

4.2 Der Open-Source-Robotik-Stack: Werkzeuge für Entwicklung und Forschung        13

4.2.1 Middleware: Robot Operating System (ROS 2)        13

4.2.2 KI- und Machine-Learning-Bibliotheken        14

4.2.3 Simulationsplattformen        14

4.2.4 Manipulations- und Navigations-Frameworks        14

Tabelle 2: Wichtige Open-Source-Robotik-Projekte und -Plattformen (2025)        15

Abschnitt 5: Entwicklung und Einsatz benutzerdefinierter Roboter-KI: Ein praktischer Leitfaden        16

5.1 Training und Feinabstimmung eigener Modelle        16

5.2 Essentielle Entwicklungs- und Einsatzwerkzeuge        17

Fazit und Ausblick        18

Referenzen        19

Einleitung

Die Robotik befindet sich an einem entscheidenden Wendepunkt. Jüngste Durchbrüche bei großen KI-Modellen (Foundation Models) katalysieren einen Paradigmenwechsel von hochspezialisierter, aufgabenspezifischer Automatisierung hin zu verkörperter Intelligenz für allgemeine Zwecke.1 Dieser Wandel verspricht Roboter, die nicht mehr nur starren Routinen folgen, sondern ihre Umgebung wahrnehmen, verstehen und flexibel auf komplexe, unvorhergesehene Situationen reagieren können.

Dieser Bericht liefert eine umfassende technische Analyse der KI-Technologien, die moderne Robotersysteme Ende 2025 antreiben. Er untersucht die zentrale Rolle multimodaler Modelle, die Mechanismen zur Umwandlung von KI-Entscheidungen in physische Bewegung, das kommerzielle und Open-Source-Ökosystem sowie die praktischen Wege für die Entwicklung und den Einsatz eigener KI-gesteuerter Robotiklösungen. Ziel ist es, ein detailliertes und nuanciertes Bild des aktuellen Stands der Technik zu zeichnen, das sowohl für Forscher als auch für Entwickler und strategische Entscheidungsträger von Relevanz ist.

Abschnitt 1: Das neue Paradigma: Grundlegende KI-Technologien in der modernen Robotik

1.1 Die KI-getriebene Revolution in der Robotik

Die Robotiklandschaft hat sich fundamental gewandelt. Traditionelle Industrieroboter, die hinter Sicherheitskäfigen operieren und streng vordefinierte, repetitive Aufgaben ausführen, werden zunehmend durch eine neue Generation von KI-gesteuerten autonomen Systemen ergänzt und ersetzt. Diese modernen Roboter sind in der Lage, ohne ständige menschliche Kontrolle zu navigieren, sich an verändernde Bedingungen anzupassen und in Echtzeit Entscheidungen zu treffen.4

Mehrere Faktoren treiben diese Entwicklung voran. Zum einen besteht die Notwendigkeit, Variabilität und Unvorhersehbarkeit in dynamischen Umgebungen zu bewältigen, sei es in der „High-Mix/Low-Volume“-Produktion oder im öffentlichen Raum.5 Zum anderen beschleunigen soziodemografische Trends wie der Arbeitskräftemangel in Schlüsselindustrien wie der Logistik und dem Gesundheitswesen die Nachfrage nach intelligenter Automatisierung.1 Gleichzeitig zwingt der globale Wettbewerb Unternehmen dazu, durch eine höhere betriebliche Effizienz und nachhaltigere Produktionsprozesse wettbewerbsfähig zu bleiben.5 Die Integration von künstlicher Intelligenz (KI) und maschinellem Lernen (ML) ist der technologische Kern dieser Revolution und ermöglicht fortschrittliche Dateninterpretation, Echtzeit-Entscheidungsfindung und vorausschauende Wartung in Robotersystemen.6

1.2 Eine Taxonomie der KI in der Robotik (IFR 2025 Framework)

Die International Federation of Robotics (IFR) hat für 2025 ein konzeptionelles Framework vorgestellt, das die verschiedenen Rollen der KI in der Robotik systematisiert.5 Dieses Framework unterscheidet drei zentrale KI-Kategorien:

1.3 Verkörperte KI: Die Konvergenz von Foundation Models und Robotik

Das übergeordnete theoretische Konzept, das diese Entwicklungen vereint, ist die „Verkörperte KI“ (Embodied AI). Es beschreibt intelligente Systeme, die durch physische Interaktion mit ihrer Umgebung wahrnehmen, schlussfolgern und handeln.2 Anstatt die für die Robotik erforderliche Intelligenz von Grund auf neu zu entwickeln, konzentriert sich die Forschung nun darauf, das immense, in vortrainierten Foundation Models (wie LLMs und Vision-Language Models) vorhandene Wissen für die physische Welt nutzbar zu machen.14 Diese Modelle, trainiert auf riesigen Mengen von Text- und Bilddaten aus dem Internet, besitzen ein implizites Verständnis von Objekten, physikalischen Zusammenhängen und menschlicher Sprache. Die zentrale Herausforderung der modernen Robotik besteht darin, dieses Wissen zu „erden“ (to ground) und in zielgerichtete, physische Aktionen zu übersetzen, um so Schlüsselprobleme wie multimodale Sensorfusion, Entscheidungsfindung unter Unsicherheit und Aufgabengeneralisierung zu lösen.2

Abschnitt 2: Vision-Language-Action (VLA) Modelle: Das Gehirn moderner Roboter

2.1 Einführung in Vision-Language-Action (VLA) Modelle

Vision-Language-Action (VLA) Modelle sind eine Klasse multimodaler KI-Systeme, die als das operative Gehirn moderner Roboter fungieren. Sie sind darauf ausgelegt, Daten aus den Modalitäten Sehen (Vision), Sprache (Language) und Handlung (Action) zu einer einheitlichen, generalisierbaren Steuerungsrichtlinie (Policy) zu vereinen.3 Architektonisch bestehen sie typischerweise aus drei Kernkomponenten: einem visuellen Encoder (z. B. ein Convolutional Neural Network oder ein Vision Transformer), der Kamerabilder verarbeitet; einem großen Sprachmodell (LLM) als Backbone, das textuelle Anweisungen und das semantische Verständnis der Szene handhabt; und einem Aktions-Decoder, der die kombinierten Informationen in konkrete Motorbefehle für den Roboter umwandelt.16

Das zentrale Versprechen der VLAs liegt in ihrer Fähigkeit, das Skalierungsproblem der traditionellen Robotik zu lösen. Anstatt für jede neue Aufgabe einen immensen Programmieraufwand durch Experten zu erfordern, sollen VLAs es Robotern ermöglichen, neue Aufgaben mit minimalen oder gar keinen zusätzlichen, aufgabenspezifischen Daten zu erlernen, indem sie einfach Anweisungen in natürlicher Sprache befolgen.3

2.2 Hochmoderne proprietäre VLA-Systeme

2.2.1 Google DeepMinds Gemini Robotics: Eine duale Modellarchitektur für verkörpertes Schließen

Google DeepMind hat mit Gemini Robotics ein innovatives System vorgestellt, das auf einer zweigeteilten Architektur basiert. Diese Struktur ist ein klares Beispiel für die Entkopplung von übergeordnetem Denken und untergeordneter Ausführung.

2.2.2 Figure AIs Helix: Ein generalistisches VLA für die Steuerung von Humanoiden

Figure AI verfolgt mit seinem Helix-Modell einen ähnlichen architektonischen Ansatz für die Steuerung seiner humanoiden Roboter.

Das Auftauchen dieser dualen Architekturen bei führenden Unternehmen wie Google und Figure AI ist kein Zufall. Es stellt ein konvergentes Designmuster dar, das eine fundamentale technische Herausforderung löst: Große Sprachmodelle sind exzellente Denker und Planer, aber sie sind zu langsam für die Echtzeit-Motorsteuerung, die Frequenzen von über 100 Hz erfordert. Durch die Schaffung eines hierarchischen Systems, das ein langsames Planungsmodul mit einer schnellen, reaktiven Steuerungsebene kombiniert, wird es möglich, die semantische Tiefe großer KI-Modelle für die physische Robotik praktisch nutzbar zu machen.

2.2.3 NVIDIAs Projekt GR00T: Ein Foundation Model für generalistische Roboter

NVIDIA positioniert sich mit Projekt GR00T als Anbieter einer grundlegenden Plattform für humanoide Roboter.

2.3 Führende Open-Source VLA-Innovationen

Während proprietäre Systeme auf integrierte Lösungen abzielen, konzentriert sich das Open-Source-Ökosystem auf Modularität, Anpassungsfähigkeit und Transparenz.

2.3.1 MolmoAct: Ein Action Reasoning Model (ARM) für erklärbare Steuerung

  1. Wahrnehmung: Das Modell kodiert Beobachtungen in tiefenbewusste Wahrnehmungs-Token, um ein 3D-Verständnis der Szene zu erlangen.
  2. Planung: Es generiert einen mittelfristigen räumlichen Plan in Form von editierbaren „visuellen Argumentationsspuren“ (Visual Reasoning Traces) – im Wesentlichen Wegpunkte im Bildraum.
  3. Steuerung: Basierend auf diesem visuellen Plan werden die untergeordneten Aktionen für den Roboter vorhergesagt.16

2.3.2 OpenVLA: Ein skalierbares Framework für die VLA-Entwicklung und -Feinabstimmung

Diese strategische Ausrichtung offenbart eine Divergenz auf dem Markt: Proprietäre Unternehmen bauen eng integrierte Hard- und Software-„Produkte“, die auf eine bestimmte Art von Roboter (oft Humanoide) zugeschnitten sind. Das Open-Source-Ökosystem hingegen schafft ein flexibles „Betriebssystem“ und Werkzeuge, die für eine breite Palette von Roboterhardware angepasst werden können, was die Innovation auf breiter Front fördert.

Tabelle 1: Führende Vision-Language-Action Modelle (2025)

Modell

Hauptentwickler

Open Source

Architektur

Basis-Foundation-Modelle (LLM/Vision)

Hauptunterscheidungsmerkmal

Gemini Robotics

Google DeepMind

Nein

Dual-Modell: Embodied Reasoning (ER) + VLA

Gemini-Familie

„Denken vor dem Handeln“; Lernen über verschiedene Embodiments hinweg

Figure Helix

Figure AI

Nein

Dual-Modell: System 2 (langsames Denken) + System 1 (schnelle Steuerung)

Proprietäres VLM

Steuerung des gesamten humanoiden Oberkörpers; Multi-Roboter-Kollaboration

NVIDIA GR00T N1

NVIDIA

Nein

Generalistisches Foundation Model + Diffusions-Decoder

Proprietär

Teil eines integrierten Hard-/Software-Ökosystems (Isaac Sim, Jetson)

MolmoAct

Allen Institute for AI et al.

Ja

Dreistufige Pipeline: Wahrnehmung, Planung, Steuerung

Molmo (basierend auf OLMo)

Erklärbarkeit und Steuerbarkeit durch „Visual Reasoning Traces“

OpenVLA

OpenVLA-Team

Ja

Skalierbares VLA-Framework

Llama-2, Vicuña / DINOv2, SigLIP

Fokus auf einfache Feinabstimmung (LoRA) und Anpassung an neue Roboter

Abschnitt 3: Von der KI-Entscheidung zur physischen Bewegung: Die Steuerungspipeline

Die Umwandlung einer von einem VLA-Modell getroffenen abstrakten Entscheidung in eine präzise, flüssige und erfolgreiche physische Bewegung ist eine der größten technischen Herausforderungen in der Robotik. Dieser Prozess, die sogenannte Steuerungspipeline, stützt sich auf spezifische Lernparadigmen und fortschrittliche Aktionsgenerierungsmodelle.

3.1 Lernparadigmen: Robotern beibringen, wie man handelt

Moderne Robotersysteme werden durch eine Kombination verschiedener Lernansätze trainiert, die jeweils spezifische Stärken und Schwächen aufweisen.

3.2 Der Aufstieg generativer Policies: Diffusion für kontinuierliche Steuerung

Traditionelle Ansätze wie die direkte Regression von Aktionen stoßen bei komplexen Manipulationsaufgaben an ihre Grenzen. Viele reale Aufgaben sind multimodal, d. h. es gibt mehrere, gleichermaßen korrekte Wege, sie zu lösen (z. B. kann eine Tasse von links oder rechts gegriffen werden). Ein Regressionsmodell, das versucht, all diese Möglichkeiten zu mitteln, erzeugt oft zögerliche oder physikalisch unsinnige Bewegungen.12

Hier haben sich Diffusions-Policies als bahnbrechende Lösung erwiesen. Anstatt eine deterministische Aktion vorherzusagen, formulieren sie die Aktionserzeugung als einen bedingten Entrauschungsprozess.7 Die Policy lernt, einen zufälligen Rauschvektor, bedingt durch die aktuelle Beobachtung des Roboters (z. B. ein Kamerabild), schrittweise in eine kohärente, hochdimensionale Aktionssequenz zu verfeinern.12 Dieser Ansatz ist nicht nur eine technische Verbesserung, sondern ein Paradigmenwechsel von einer deterministischen zu einer probabilistischen Steuerung. Die Policy lernt nicht mehr „die eine richtige Aktion“, sondern die gesamte Verteilung aller möglichen guten Aktionen. Zur Ausführungszeit wählt sie eine kohärente Lösung aus dieser Verteilung aus, was zu deutlich flüssigeren und robusteren Verhaltensweisen führt.

Diffusions-Policies bieten mehrere entscheidende Vorteile:

Diese Technik wird oft mit einer „Receding Horizon Control“ kombiniert. Dabei plant die Policy eine kurze Aktionssequenz, führt aber nur den ersten Schritt aus. Dann nimmt sie eine neue Beobachtung auf und plant erneut. Dies stellt einen eleganten Kompromiss zwischen der Notwendigkeit einer vorausschauenden Planung für flüssige Bewegungen und der Fähigkeit zur sofortigen Reaktion auf eine dynamische Umgebung dar.12

3.3 Die Rolle der Wahrnehmung: KI-basiertes SLAM

Während VLAs Wahrnehmung oft End-to-End durchführen, benötigen viele mobile Roboter, insbesondere in der Logistik und im Außeneinsatz, weiterhin eine explizite Zustandsschätzung. Hier spielt Simultaneous Localization and Mapping (SLAM) eine entscheidende Rolle. KI- und Deep-Learning-Methoden revolutionieren auch diesen Bereich. Anstatt sich auf handgefertigte Merkmale zu verlassen, verwenden moderne SLAM-Systeme neuronale Netze (insbesondere CNNs) zur robusteren Merkmalsextraktion aus Kamerabildern oder LiDAR-Daten. Transformer-Architekturen verbessern das räumliche Schließen und die Vorhersage von Bewegungen, während semantisches SLAM es dem Roboter ermöglicht, die Umgebung nicht nur geometrisch, sondern auch konzeptuell zu verstehen (z. B. zu erkennen, dass ein bestimmter Bereich ein „Tisch“ oder eine „Tür“ ist).35 Eine präzise und robuste Lokalisierung ist eine grundlegende Voraussetzung für jede nachfolgende KI-basierte Entscheidungsfindung. Der prognostizierte starke Anstieg des Marktes für SLAM-Robotik unterstreicht seine anhaltende Bedeutung.37

Abschnitt 4: Das Robotik-Ökosystem: Kommerzielle und Open-Source-Plattformen

Das Ökosystem der Robotik im Jahr 2025 ist durch eine dynamische Koexistenz von etablierten Industrieunternehmen, agilen KI-Start-ups und einer robusten Open-Source-Community gekennzeichnet. Diese Akteure verfolgen unterschiedliche Geschäftsmodelle, die den Markt prägen.

4.1 Führende kommerzielle Robotikunternehmen und -plattformen

Der Markt lässt sich grob in zwei Kategorien einteilen: traditionelle Anbieter von Industrieautomation und eine neue Welle von KI-nativen Innovatoren.

Diese Marktstruktur offenbart eine klare Bifurkation in den Geschäftsmodellen. Unternehmen wie Boston Dynamics oder Figure AI verfolgen ein vertikal integriertes Modell, bei dem sie ein komplettes „Roboter-als-Produkt“ anbieten, bei dem Hardware und KI eng miteinander verknüpft sind. Im Gegensatz dazu agieren Unternehmen wie NVIDIA und die Open-Source-Community als horizontal integrierte „Plattform- und Werkzeuganbieter“. Sie liefern die „Schaufeln und Spitzhacken“ für den Goldrausch in der Robotik – die Simulationsumgebungen, KI-Modelle und Middleware, die von anderen Unternehmen zur Entwicklung ihrer eigenen Roboter genutzt werden.

4.2 Der Open-Source-Robotik-Stack: Werkzeuge für Entwicklung und Forschung

Die Open-Source-Community bildet das Rückgrat der Forschung und Entwicklung in der Robotik. Ein reichhaltiges Ökosystem an Werkzeugen ermöglicht es Forschern und Unternehmen, auf bewährten Komponenten aufzubauen.

4.2.1 Middleware: Robot Operating System (ROS 2)

ROS 2 ist das De-facto-Standard-Middleware-Framework für die Robotik. Es bietet eine flexible, modulare Architektur für die Kommunikation zwischen den verschiedenen Softwarekomponenten eines Roboters, von Sensortreibern über Wahrnehmungsalgorithmen bis hin zur Bewegungsplanung. Seine Echtzeitfähigkeit und plattformübergreifende Unterstützung machen es zur idealen Grundlage für moderne KI-Anwendungen.41

4.2.2 KI- und Machine-Learning-Bibliotheken

4.2.3 Simulationsplattformen

4.2.4 Manipulations- und Navigations-Frameworks

Die zunehmende Bedeutung von Software und KI führt auch dazu, dass sich die Definition eines „Robotikunternehmens“ auflöst. Große Technologiekonzerne wie Microsoft (Azure AI), Google (Robotics AI Platform) und Amazon (AWS RoboMaker) sind zu zentralen Akteuren im Ökosystem geworden. Sie stellen die Cloud-Infrastruktur, Simulationsdienste und grundlegenden KI-Modelle bereit, die für die Entwicklung moderner Roboter unerlässlich sind.41 Robotik ist nicht mehr nur ein mechanisches Problem, sondern in erster Linie ein Software- und Datenproblem, was diese Technologiegiganten zu unverzichtbaren Partnern in der Branche macht.

Tabelle 2: Wichtige Open-Source-Robotik-Projekte und -Plattformen (2025)

Projektname

Kategorie

Hauptverantwortliche(r)

Primäre Funktion/Zweck

Lizenz

ROS 2

Middleware

Open Robotics / Intrinsic

Kommunikationsframework und Werkzeugsatz für Roboter-Software

Apache 2.0

Gazebo

Simulator

Open Robotics / Intrinsic

Physikbasierter 3D-Simulator für Robotik

Apache 2.0

NVIDIA Isaac Sim

Simulator

NVIDIA

Fotorealistischer Simulator für KI-Training und synthetische Datengenerierung

Proprietär (kostenlos)

LeRobot

KI-Bibliothek

Hugging Face

PyTorch-Bibliothek für Imitations- und bestärkendes Lernen

Apache 2.0

OpenVLA

KI-Framework

OpenVLA-Team

Framework zum Trainieren und Feinabstimmen von VLA-Modellen

MIT / Llama License

MolmoAct

KI-Modell

Allen Institute for AI et al.

Open-Source Action Reasoning Model für erklärbare Steuerung

Apache 2.0

MoveIt

Manipulation

PickNik Robotics

Framework für Bewegungsplanung und Manipulation

BSD 3-Clause

Nav2 Stack

Navigation

Open Navigation

Vollständiger Navigationsstack für mobile Roboter in ROS 2

Apache 2.0

OpenCV

Computer Vision

OpenCV.org

Umfassende Bibliothek für Bildverarbeitungsalgorithmen

Apache 2.0

Abschnitt 5: Entwicklung und Einsatz benutzerdefinierter Roboter-KI: Ein praktischer Leitfaden

Für Anwender, die eigene KI-gesteuerte Robotersysteme entwickeln oder anpassen möchten, hat sich der Entwicklungsprozess grundlegend verändert. Er ist nicht mehr primär code-zentriert, sondern daten-zentriert.

5.1 Training und Feinabstimmung eigener Modelle

Der entscheidende Engpass bei der Entwicklung von Roboter-KI bleibt die Verfügbarkeit von qualitativ hochwertigen, umfangreichen Datensätzen von Roboteraktionen.7

Der Arbeitsablauf eines modernen Robotik-Ingenieurs verlagert sich somit weg vom Schreiben komplexer Steuerungsalgorithmen hin zu Aufgaben, die denen eines Datenwissenschaftlers ähneln: Sammeln von Demonstrationen, Kuratieren von Datensätzen, Aufbau von Simulationsumgebungen und Management von Trainings- und Feinabstimmungspipelines.

5.2 Essentielle Entwicklungs- und Einsatzwerkzeuge

Dank des ausgereiften Open-Source-Ökosystems ist es heute erstmals möglich, eine vollständige, hochmoderne Toolchain für die Entwicklung von Roboter-KI zusammenzustellen, was den Zugang zu dieser Technologie demokratisiert.

  1. ROS 2 als grundlegende Middleware-Architektur.41
  2. Gazebo (für den Einstieg) oder Isaac Sim (für fortgeschrittene KI) als Simulationsumgebung.44
  3. LeRobot oder OpenVLA, um mit vortrainierten Policies und Datensätzen zu experimentieren und die Grundlagen des Imitationslernens zu erlernen.17
  4. Für den Übergang zur realen Welt bieten sich zugängliche Open-Source-Hardwareplattformen wie der TurtleBot für Navigationsaufgaben oder Roboterarme von Herstellern wie Evezor an, die mit Frameworks wie MoveIt kompatibel sind.23

Die Verfügbarkeit und Reife dieser Komponenten bedeutet, dass einzelne Forscher oder kleine Start-ups heute Zugang zu derselben Klasse von Werkzeugen haben, die früher nur großen Forschungs- und Entwicklungslabors von Unternehmen zur Verfügung standen. Dies beschleunigt das Innovationstempo in der gesamten Branche erheblich.

Fazit und Ausblick

Die Robotik des Jahres 2025 wird von der tiefen Integration fortschrittlicher KI-Technologien geprägt. Die Analyse zeigt mehrere klare Trends:

  1. Dominanz multimodaler Modelle: Vision-Language-Action (VLA) Modelle sind zum Standard für die Steuerung intelligenter Roboter geworden und ermöglichen eine intuitive Interaktion über natürliche Sprache.
  2. Architektonische Konvergenz: Führende Systeme setzen auf eine entkoppelte Architektur, die hochrangiges, langsames Schließen von schneller, reaktiver Motorsteuerung trennt. Dies ist ein entscheidender technischer Kompromiss, um die Leistungsfähigkeit großer KI-Modelle in der physischen Welt nutzbar zu machen.
  3. Aufstieg generativer Policies: Diffusionsmodelle haben sich als überlegene Methode zur Erzeugung flüssiger, robuster und multimodaler Bewegungen für komplexe Manipulationsaufgaben etabliert.
  4. Ein duales Ökosystem: Der Markt wird sowohl von proprietären, vertikal integrierten Systemen als auch von einem dynamischen, horizontalen Open-Source-Ökosystem geprägt, das die Entwicklung demokratisiert und Innovationen vorantreibt.

Trotz dieser enormen Fortschritte bleiben zentrale Herausforderungen bestehen. Der Engpass bei realen Aktionsdaten ist nach wie vor die größte Hürde.7 Die Verbesserung der Übertragbarkeit von der Simulation auf die Realität (Sim-to-Real) 8, die Gewährleistung von Sicherheit und Erklärbarkeit 9 sowie das Erreichen einer echten Generalisierung über verschiedene Roboter-Embodiments hinweg 2 sind die Hauptforschungsfelder für die kommenden Jahre.

Die Verschmelzung von groß angelegter KI mit der Robotik hat einen unumkehrbaren Weg in Richtung universell einsetzbarer Roboter eingeschlagen. Die hier vorgestellten Technologien und Plattformen sind die Bausteine, aus denen die nächste Generation autonomer Systeme konstruiert wird, die das Potenzial haben, Industrie, Dienstleistungen und unseren Alltag grundlegend zu verändern.

Referenzen

  1. International Federation of Robotics, Zugriff am Oktober 14, 2025, https://ifr.org/
  2. [2505.20503] Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2505.20503
  3. [2510.07077] Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2510.07077
  4. The future of robotics: 7 predictions shaping 2025 and beyond - Standard Bots, Zugriff am Oktober 14, 2025, https://standardbots.com/blog/future-of-robotics-predictions
  5. TOP 5 Global Robotics Trends 2025 - International Federation of ..., Zugriff am Oktober 14, 2025, https://ifr.org/ifr-press-releases/news/top-5-global-robotics-trends-2025
  6. Robotic Trends in 2025: Innovations Transforming Industries | Robotnik ®, Zugriff am Oktober 14, 2025, https://robotnik.eu/robotic-trends-in-2025-innovations-transforming-industries/
  7. RoboBERT: An End-to-end Multimodal Robotic Manipulation Model - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2502.07837v1
  8. Generative Artificial Intelligence in Robotic Manipulation: A Survey - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2503.03464v1
  9. [2408.07806] From Decision to Action in Surgical Autonomy: Multi-Modal Large Language Models for Robot-Assisted Blood Suction - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2408.07806
  10. Language-Conditioned Imitation Learning for Robot Manipulation Tasks, Zugriff am Oktober 14, 2025, https://proceedings.neurips.cc/paper/2020/file/9909794d52985cbc5d95c26e31125d1a-Paper.pdf
  11. Vision Language Action Models (VLA) & Policies for Robots, Zugriff am Oktober 14, 2025, https://learnopencv.com/vision-language-action-models-lerobot-policy/
  12. Diffusion Policy: - Robotics, Zugriff am Oktober 14, 2025, https://www.roboticsproceedings.org/rss19/p026.pdf
  13. [Literature Review] Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges - Moonlight, Zugriff am Oktober 14, 2025, https://www.themoonlight.io/en/review/robotic-manipulation-via-imitation-learning-taxonomy-evolution-benchmark-and-challenges
  14. Helix: A Vision-Language-Action Model for Generalist Humanoid ..., Zugriff am Oktober 14, 2025, https://www.figure.ai/news/helix
  15. MolmoAct: Action Reasoning Models that can Reason in Space - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/394439828_MolmoAct_Action_Reasoning_Models_that_can_Reason_in_Space
  16. MolmoAct: Action Reasoning Models that can Reason in Space - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/html/2508.07917v1
  17. openvla/openvla: OpenVLA: An open-source vision ... - GitHub, Zugriff am Oktober 14, 2025, https://github.com/openvla/openvla
  18. Gemini Robotics 1.5 brings AI agents into the physical world - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
  19. Building the Next Generation of Physical Agents with Gemini Robotics-ER 1.5, Zugriff am Oktober 14, 2025, https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/
  20. Gemini Robotics 1.5 - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/models/gemini-robotics/gemini-robotics/
  21. Responsibly advancing AI and robotics - Google DeepMind, Zugriff am Oktober 14, 2025, https://deepmind.google/models/gemini-robotics/responsibly-advancing-ai-and-robotics/
  22. Gemini Robotics-ER 1.5 | Gemini API | Google AI for Developers, Zugriff am Oktober 14, 2025, https://ai.google.dev/gemini-api/docs/robotics-overview
  23. The Most Promising Open Source Robotics Startups in 2025 ..., Zugriff am Oktober 14, 2025, https://www.hackster.io/news/the-most-promising-open-source-robotics-startups-in-2025-c576072e1e07
  24. MolmoAct: An Action Reasoning Model that reasons in 3D space - Ai2, Zugriff am Oktober 14, 2025, https://allenai.org/blog/molmoact
  25. MolmoAct: Action Reasoning Models that can Reason in Space - Hugging Face, Zugriff am Oktober 14, 2025, https://huggingface.co/papers/2508.07917
  26. Coarse-to-Fine Imitation Learning: Robot Manipulation from a Single Demonstration, Zugriff am Oktober 14, 2025, https://www.robot-learning.uk/coarse-to-fine-imitation-learning
  27. Why use imitation learning for robotic arm manipulation, and what are the issues when starting from 3D reconstruction? | ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/post/Why_use_imitation_learning_for_robotic_arm_manipulation_and_what_are_the_issues_when_starting_from_3D_reconstruction
  28. AI-Driven Control Strategies for Biomimetic Robotics: Trends, Challenges, and Future Directions - MDPI, Zugriff am Oktober 14, 2025, https://www.mdpi.com/2313-7673/10/7/460
  29. (PDF) AI Motion Control – A Generic Approach to Develop Control Policies for Robotic Manipulation Tasks - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/334712774_AI_Motion_Control_-_A_Generic_Approach_to_Develop_Control_Policies_for_Robotic_Manipulation_Tasks
  30. Learning for a Robot: Deep Reinforcement Learning, Imitation Learning, Transfer Learning - MDPI, Zugriff am Oktober 14, 2025, https://www.mdpi.com/1424-8220/21/4/1278
  31. Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation - arXiv, Zugriff am Oktober 14, 2025, https://arxiv.org/abs/2505.12744
  32. Diffusion Policy Policy Optimization, Zugriff am Oktober 14, 2025, https://diffusion-ppo.github.io/
  33. Diffusion Policy, Zugriff am Oktober 14, 2025, https://diffusion-policy.cs.columbia.edu/
  34. Reactive Diffusion Policy - Robotics, Zugriff am Oktober 14, 2025, https://www.roboticsproceedings.org/rss21/p052.pdf
  35. (PDF) Mastering SLAM: Techniques, Algorithms, and Applications in Artificial Intelligence and Autonomous Systems - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/395070043_Mastering_SLAM_Techniques_Algorithms_and_Applications_in_Artificial_Intelligence_and_Autonomous_Systems
  36. (PDF) Advances in AI-Driven SLAM: Recent Breakthroughs and Future Directions for Robust Autonomous Navigation in GPS-Denied Environments - ResearchGate, Zugriff am Oktober 14, 2025, https://www.researchgate.net/publication/389785093_Advances_in_AI-Driven_SLAM_Recent_Breakthroughs_and_Future_Directions_for_Robust_Autonomous_Navigation_in_GPS-Denied_Environments
  37. SLAM Robotics Analysis 2025 and Forecasts 2033: Unveiling Growth Opportunities, Zugriff am Oktober 14, 2025, https://www.archivemarketresearch.com/reports/slam-robotics-472104
  38. Top AI robotics companies to watch in 2025 (and what they're ..., Zugriff am Oktober 14, 2025, https://standardbots.com/blog/ai-robotics-companies
  39. Top 7 Robotics Companies (2025): Revolutionizing Automation - eWeek, Zugriff am Oktober 14, 2025, https://www.eweek.com/artificial-intelligence/robotics-companies/
  40. 34 Robotics Companies & Startups to Know in 2025 | Built In, Zugriff am Oktober 14, 2025, https://builtin.com/robotics/robotics-companies-roundup
  41. Top 10 AI Robotics Platforms Tools in 2025: Features, Pros, Cons ..., Zugriff am Oktober 14, 2025, https://www.devopsschool.com/blog/top-10-ai-robotics-platforms-tools-in-2025-features-pros-cons-comparison/
  42. Top 20 open-source robotics projects and initiatives for robotics research - RoboticsBiz, Zugriff am Oktober 14, 2025, https://roboticsbiz.com/top-20-open-source-robotics-projects-and-initiatives-for-robotics-research/ (Internet-Archive-Snapshot vom 16.07.2025)
  43. huggingface/lerobot: LeRobot: Making AI for Robotics more ... - GitHub, Zugriff am Oktober 14, 2025, https://github.com/huggingface/lerobot
  44. Top AI Tools for ROS 2 Robotics Projects (2024 Guide) - Arsturn, Zugriff am Oktober 14, 2025, https://www.arsturn.com/blog/the-ultimate-guide-to-ai-tools-for-ros-2-projects
  45. Top AI Platforms to Drive Business Growth in 2025 - Curotec, Zugriff am Oktober 14, 2025, https://www.curotec.com/insights/leading-ai-platforms/

Heutige Arbeit

Unsere Entwicklung und Forschung.

Aktuelle Systeme und Forschungsarbeiten finden Sie in den Bereichen Entwicklung und Forschung.

Entwicklungen ansehen