Ergebnisse

Die Messmatrix

Alle Zahlen entstanden mit demselben, über die gesamte Kampagne unveränderten Bewertungsmaßstab. Grün heißt: Schwelle der Dimension erreicht. Sieben Modelle in elf Läufen über 26 Fälle – die Spitzensysteme claude-opus-5 und gpt-5.6-sol mit je drei Läufen als Varianzindikator.

Kurz und einfach: Sieben KI-Modelle, elf Läufe, 26 Zeichnungen. Das beste System trifft die Körperform fast immer — an allen Anforderungen zugleich scheitern aber auch seine Läufe noch oft. Die Tabellen zeigen beides. Unbekannte Begriffe erklärt das Glossar.

Fall-für-Fall-Vergleich öffnen — jedes Modell in 3D neben dem Original

Aggregat je Modell

Absteigend nach Formtreue sortiert; je Agent-Modell-System eine Zeile — die dreifach gemessenen Spitzensysteme gehen mit dem Mittel ihrer Läufe ein, die Einzelläufe stehen in der Wiederholbarkeit und im Fall-für-Fall-Vergleich. Ein Klick auf einen Dimensions-Kopf sortiert nach dieser Kennzahl. Die Spalte Abgeliefert zeigt, wie viele der 26 Korpus-Fälle ein bewertbares Modell ergaben. Das Bestehen steht in zwei Quoten. Das Hauptergebnis ist „bestanden (erreichbar)“: jede Dimension über der Schwelle oder an ihrem fall-spezifischen Maximum. Die technische Vergleichszahl „formal (Rohwert)“ verlangt alle Rohwerte über den Schwellen — das können 16 der 26 Fälle wegen ihrer Maßtreue-Obergrenze konstruktionsbedingt nicht; die Erklärung mit Rechenbeispiel steht unter der Tabelle.

Kennzahlen im Überblick: Die Tabelle zeigt die vier je Fall gemessenen Dimensionen (Maßtreue, Merkmalstreue, Formtreue, Zeichnungstreue). Die Gewindetreue gilt nur für Gewindefälle und fehlt deshalb hier; die Ablieferquote ist keine Dimension, sondern zählt, ob ein bewertbares Modell ankam. Details: Methodik — die fünf Dimensionen.

Aggregate werden geladen …

Dimensionen im Vergleich

Je Dimension ein Balken pro Modell; die senkrechte Linie markiert die Bestehensschwelle.

Diagramme werden geladen …

Verankerte und unabhängige Fälle

Sieben der Fälle sind Verankerungsfälle: An ihnen wurden die Erfahrungsregeln der Agenten geschärft, ihr Ergebnis ist deshalb optimistisch verzerrt. Der saubere Generalisierungstest sind die übrigen unabhängigen Fälle. Beide Teilmengen werden getrennt ausgewiesen – ein Mittelwert über alles würde beides verwischen. Dass die Verankerungsfälle im Mittel trotzdem schlechter abschneiden, ist kein Widerspruch: Sie wurden gerade deshalb zur Verankerung gewählt, weil frühe Läufe an ihnen scheiterten — es sind die schwereren Bauteile. Die Verzerrungswarnung betrifft die Trainingsnähe (Training = Test), nicht die absolute Punkthöhe.

Teilmengen werden geladen …

Wiederholbarkeit (n = 3)

Agentenläufe sind stochastisch. Für die beiden dreifach gemessenen Spitzensysteme zeigt diese Tabelle, wie stark die Formtreue eines Falls zwischen den Läufen schwankt – die Rauschbreite, ohne die ein Modellvergleich auf Fallebene nicht interpretierbar ist. Bemerkenswert: Die Aggregate sind über drei Läufe stabil (claude-opus-5 0,918–0,954; gpt-5.6-sol 0,668–0,691), während einzelne Fälle weiterhin um mehrere Zehntel springen.

Wiederholbarkeit wird geladen …

Was aus der Matrix folgt

Wer gewinnt: Nach der Leitdimension Formtreue liegt Claude Code mit claude-opus-5 deutlich vorn (Formtreue 0,935 im Mittel über drei Läufe, Einzelläufe 0,918–0,954; 78/78 abgeliefert); gpt-5.6-sol erreicht in einzelnen Läufen die beste Maß- und Zeichnungstreue, fällt bei der Form aber ab (≈0,68).

Was das praktisch heißt: Das beste System rekonstruiert die Körper dieser Aufgaben fast durchgängig deckungsgleich und besteht im Mittel 20 von 26 Fällen unter den erreichbaren Maßen (bester Lauf: 21) — bei sichtbarer Streuung zwischen den Läufen desselben Modells.

Was es nicht heißt: Ingenieurarbeit ist damit nicht ersetzt. Toleranzen, Werkstoff, Simulation und Fertigung sind nicht Teil der Messung; die Prüfung und Freigabe bleibt bei einer Fachkraft.

Was genau verglichen wird: Jede Zeile ist ein Agent-Modell-System — Kommandozeilen-Agent (Claude Code bzw. codex) samt Sprachmodell. Der Einfluss des Modells lässt sich in diesem Aufbau nicht vom Einfluss des Agenten trennen.

Jeden Fall selbst prüfen

Der Fall-für-Fall-Vergleich zeigt zu jedem der 26 Fälle das Original-Quellvideo neben den interaktiven 3D-Ansichten aller elf Läufe — inklusive des vollständig gezeigten eigenen Lagerbock-Falls.

Zum Fall-für-Fall-Vergleich