Aus unserem Forschungsprogramm

Ausgewählte Forschungsfelder für KI-Agenten in Fachsoftware.

Unser Forschungsprogramm untersucht, wie KI-Agenten fachliche Aufgaben bearbeiten, wie ihre Ergebnisse methodisch bewertet werden und wie sich KI tief in GIS- und CAD-Systeme integrieren lässt. Hier stellen wir ausgewählte Schwerpunkte vor: SpatialAgents Benchmarks, CAD-Agents, SpatialApp und Holistech Labs.

SpatialAgents Benchmarks · Benchmark 08

Ein QGIS-Workflow, sieben Agent-Modell-Systeme.

Benchmark 08 untersucht eine mehrstufige Klima- und Gefahrenanalyse für ein Untersuchungsgebiet in Stuttgart.

Die SpatialAgents des jeweiligen Laufs bearbeiten den Workflow in QGIS und erzeugen strukturierte Projekt-, Daten- und Kartenartefakte. Sieben Agent-Modell-Systeme bearbeiten dieselbe Aufgabe in je drei Läufen, sechs davon in der Cloud und eines lokal auf einem Notebook. Weitere SpatialAgents Benchmarks werden diesen Forschungsbereich ergänzen.

Vollständige Benchmarkakte öffnen
QGIS-Projekt aus SpatialAgents Benchmark 08 mit Risikoebenen, Gebäuden und Evakuierungsrouten
Benchmark 08 / QGIS-ProjektDas QGIS-Projekt eines gültigen Benchmarklaufs mit den erzeugten Risiko- und Evakuierungsebenen.

Ergebnisse von Benchmark 08.

Ergebnisse von Benchmark 08, Punkte von 100
ModellAgentAusführungLauf 1Lauf 2Lauf 3MittelBand
Claude Opus 5Claude CodeCloud92919091,0Gold
Claude Sonnet 5Claude CodeCloud85858685,3Gold
Qwen3.8-Flash-NextOpenCodelokal · HP ZBook81838783,7Silber
GPT-5.6 SolCodex CLICloud78838381,3Silber
GPT-5.6 TerraCodex CLICloud78757977,3Silber
GPT-5.6 LunaCodex CLICloud71727572,7Silber
Claude Haiku 4.5Claude CodeCloud53595254,7Bestanden

Die Mittelwerte ergeben sich aus den drei dargestellten Läufen je Modell. Aufgenommen wurden 21 Läufe; vier gewertete Läufe blieben ausgeschlossen, drei Läufe scheiterten an der Umgebung.

Qwen3.8-Flash-Next lief lokal auf einem HP ZBook Ultra G1a und erreicht 83,7 Punkte — mehr als jede der drei GPT-5.6-Varianten in der Cloud. Im Lokalbetrieb verlässt keine Anfrage das eigene Netz. Dieselbe Maschine trägt unsere Messreihe zu Inferenz-Engines im Abschnitt Holistech Labs.

SpatialAgents Benchmarks · Behördenakte Alpen

Acht Behördenaufgaben auf offenen ALKIS-Daten.

Die zweite Messreihe prüft B20 bis B27 an Aufgaben einer Gemeindeverwaltung: Betroffenheit im Überschwemmungsgebiet, Abstände zu Wohnbebauung und Schutzgebieten, Flächenbilanz, Grünanteil, Umprojektion und Geometriereparatur.

34Läufe
gewertetüber 8 Aufgaben und zwei Modelle
17 von 17Gold
Qwen3.8-Flash-Nextlokal auf einem Notebook
16 von 17Gold
Claude Sonnet 5in der Cloud, ein Lauf gescheitert
10Läufe
ungültiggetrennt geführt, nicht gewertet

Jede Prüfung nennt ihre Evidenz, jedes Kartenbild ist dokumentiert. Die vollständige Akte liegt auf spatialagents.de.

Behördenakte öffnen

CAD-Agents

Fünf Dimensionen für CAD-Rekonstruktionen.

Das CAD-Testlabor bewertet Maßtreue, Merkmalstreue, Formtreue, Zeichnungstreue und bei Gewindefällen Gewindetreue.

Forschungsseite öffnen
Gesamtworkflow von CAD-Agents: technische Zeichnung, KI-Agent, CAD-Aufbau mit FreeCAD, Ablieferung, Bewertung und Ergebnismatrix
CAD-Agents / GesamtworkflowVon der technischen Zeichnung über KI-Agent und FreeCAD bis zur Bewertung und Ergebnismatrix.

SpatialApp · tiefe KI-Integration

GIS-Anwendung und SpatialAgents als gemeinsames System erforschen.

Mit SpatialApp erforschen wir, wie SpatialAgents tief in GIS-Anwendungen integriert werden können.

SpatialAgents können Geodaten und Anwendungszustände strukturiert erfassen, GIS-Funktionen ausführen, Benutzeroberflächen bedienen und die Wirkung ihrer Arbeit überprüfen. Visuelle Hinweise, reproduzierbare Arbeitsabläufe und spezialisierte GIS-Anwendungen sind Teil derselben Plattform.

Düngewende als Fachanwendung ansehen ↗
SpatialApp-Beispielprojekt mit thematischen Risikoebenen und dem Lesezeichen Hochrisiko in Basel
SpatialApp / BeispielprojektThematische Risikoebenen und das Lesezeichen „Hochrisiko“ in Basel.
SpatialAgents-Guide in SpatialApp am Hochrisiko-Bereich in Basel
SpatialApp / SpatialAgentsDie Interaction-API verbindet SpatialAgents mit sichtbaren Hinweisen und dem fachlich definierten Kartenausschnitt.

Holistech Labs

Messungen, die sich nachrechnen lassen.

Unser Messlabor prüft Hardware, Inferenz-Engines und Modelle unter kontrollierten Bedingungen und veröffentlicht die Laufprotokolle. Bisher zwei Messreihen, beide auf demselben mobilen Arbeitsplatz. Dieselbe Maschine löst in Benchmark 08 die fachliche Aufgabe.

Messung · 8. September 2026

llama.cpp gegen halogen-flash-server.

Dasselbe Modell, dieselben zwanzig Aufgaben, dieselbe Reihenfolge: 17 gegen 18 gelöste Aufgaben, aber 486 gegen 157 Minuten.

Punktdiagramm der Laufzeit aller zwanzig Aufgaben, logarithmisch von 30 Sekunden bis über 100 Minuten: je Aufgabe ein Punkt für llama.cpp und einer für halogen, halogen liegt durchgängig weiter links und damit schneller; offene Kreise stehen für nicht gelöste Aufgaben
Bericht 01 / Laufzeit je AufgabeJede der zwanzig Aufgaben einzeln: Der Abstand zieht sich durch den ganzen Satz und beruht nicht auf wenigen Ausreißern.

Qwen3.8-Flash-Next auf dem HP ZBook Ultra G1a

886Token/s
Prompt-Verarbeitungbei 69.000 Token Kontext
39,9Token/s
Ausgabe im langen Kontextdieselben 69.000 Token im Vorlauf
39,3Token/s
Ausgabe im Chatkurze Fragen, unter 800 Token Prompt
157Minuten
für alle zwanzig Aufgaben339.134 Token erzeugt

Gemessen mit halogen-flash-server. Mittelwerte über die Aufgaben der jeweiligen Gruppe, gemessen an den Antworten des Laufs selbst, nicht an Füllsätzen. Temperatur 0, Prompt-Cache aus, 70 W GPU-Budget.

Messbericht öffnen

Messung · 15. Juni 2025

Neun Modelle auf derselben Maschine.

Vom 0,6-Milliarden-Modell bis über 100 Milliarden: Ausgabetempo, Wartezeit und Wiederholbarkeit über je drei Läufe. Zwischen dem schnellsten und dem langsamsten Modell liegt Faktor 9,5.

Messbericht öffnen