Blank white background with no objects or features visible.

Wir stellen Ihnen den vollständigen Gartner Hype Cycle für KI-Governance 2026 kostenlos zur Verfügung. Hier Exemplar sichern →

Loops, Harnesses und 6.000 Ingenieure: Was die World's Fair bestätigt hat – und was heute bereitgestellt wird

von Boyu Wang

Published: October 6, 2026

AI Engineer World's Fair (AIEWF) 2026 – über 6.000 Ingenieure, 300 Redner, 29 Themenbereiche und mehr als 100 Expo-Partner an vier Tagen (ai.engineer/worldsfair/2026) – ist eine der präzisesten jährlichen Momentaufnahmen der Branche. Die diesjährige Bestandsaufnahme hatte eine klare Struktur. Die Woche begann mit Loops: swyx (Mitbegründer der AIEWF) nannte seinen Eröffnungsvortrag „Loopcraft: The Art of Stacking Loops“, und der tägliche Newsletter seiner Publikation brachte es auf den Punkt: „Loops, Loops und noch mehr Loops“ dominierten den ersten vollen Tag, von Cron-Job-Automatisierungen bis hin zu Geoffrey Huntleys mittlerweile kanonischer Behauptung, dass „alles ein Ralph-Loop ist“ (latent.space). Zur Wochenmitte verlagerte sich der Fokus auf Verifizierung, als der Datensatz von Greptile zeigte, dass KI-generierter Code mittlerweile 27,6 % der zusammengeführten Pull Requests ausmacht – ein Anstieg von unter 1 % vor vierzehn Monaten – und Sonar die unbequeme Begleitzahl betonte: Etwa 48 % dieses Codes werden vor dem Zusammenführen explizit überprüft (wie in der Konferenzberichterstattung auf chatforest.com) berichtet). Und sie endete mit dem HarnessDer Keynote-Slot am letzten Tag gehörte Harness Engineering selbst, mit Mike Krieger, Co-Leiter von Anthropic Labs, als Hauptredner. Loops, Verifizierung, Harness – dieser Bogen ist kein Konferenzplan. Es ist eine Architektur. Und es ist die Architektur, die TrueFoundry heute dokumentiert und ausliefert.

Key Takeaways

Key Takeaways

  • AIEWF 2026's arc ran loops → verification → harness: swyx opened on "Loopcraft," Greptile and Sonar quantified the verification gap mid-week, and the closing keynote belonged to Harness Engineering with Anthropic's Mike Krieger.
  • swyx's three-year retrospective named the shift outright: "the model alone is no longer the product," and prompt engineering "gave way to rigorous evals," RL environments, and context/harness engineering (dev.to).
  • The reported numbers point in the same direction: with AI writing a reported 27.6% of merged PRs and only ~48% of AI-generated code explicitly reviewed, generation has outrun verification — the gap is closed by harness infrastructure, not vigilance.
  • TrueFoundry's Agent Harness ships the keynote discipline as documentation: managed plan-act-observe loop, sandboxed execution, human-in-the-loop approval gates, memory for long-running tasks, and no credentials in agent definitions.
  • The loop discourse lands on the same surface: budgets, step ceilings, retries, and stall safeguards for governed runs — the cost half of which our Tokenmaxxing series treats end to end at the Agent Gateway are what make a stacked loop a production system instead of a token bonfire.
  • Verification ships as the continuous evaluation layer plus per-step traces — the quality gate the 48% figure says most pipelines are missing.
  • Honest note: a harness governs and bounds; it doesn't make a weak model strong or a bad task decomposition good — the frontier keynoted the layer because it changes failure economics, not because it abolishes failure.

1. Die Woche in drei Zitaten

Beginnen wir mit dem Rückblick, denn er bildet den Rahmen für alles Weitere. In seiner Begrüßung zur offiziellen Tageszeitung der Konferenz markierte swyx den dritten Jahrestag von „The Rise of the AI Engineer“ und fasste die Entwicklung der These zusammen: Von Top-Startups bis hin zu den Frontier-Labs sagt heute jeder: „Das Modell allein ist nicht mehr das Produkt“, und Prompt Engineering „wich rigorosen Evals“, RL-Umgebungen für das Post-Training sowie Kontext- und Harness-Engineering (dev.to/dailycontext). Dann die Obsession des ersten Tages: Der Latent.Space-Bericht meldete, dass das Wort Loop „die Gespräche dominierte“ – swyx’ eigene „Loopcraft“-Keynote skizzierte die Entwicklung des Fachbereichs „von Chat über Tools und Ziele“ hin zu Automatisierungen, und der Track „Software Factories“ baute den Tag um persistente Agenten-Loops auf, die gegen Spezifikationen laufen (latent.space). Und der Abschluss: Die Keynote des letzten Tages war Harness Engineering – die Berichterstattung fasste die gesamte viertägige Entwicklung als etwas zusammen, das „durch Infrastruktur und Governance bezahlt“ wurde, wobei Kriegers Entwicklerphilosophie als „Frontier-far“ (grenzüberschreitend) zusammengefasst wurde (chatforest.com). Ein Beobachter aus der Community brachte den strukturellen Punkt am besten auf den Punkt: Vor drei Jahren waren „KI-Agenten“ ein einziger Track – dieses Jahr benötigte derselbe Umfang neun (dev.to/hanzla). Das Feld wurde nicht lauter. Es wurde spezifisch – und die Spezifika sind Infrastruktur.

2. Warum der Bogen eine Architektur ist

Loops, Verifizierung und Harness sind keine drei Themen; sie sind eine Abhängigkeitskette. Ein Loop ist ein Agent, der weiterläuft – die Cron-Job-Automatisierungen und Ralph-Loop-Worker, die am ersten Tag gefeiert wurden – und ein Loop, der weiterläuft, vervielfacht den Output über das hinaus, was Menschen überprüfen können. Darauf deuteten auch die gemeldeten Zahlen zur Wochenmitte hin: 27,6 % der zusammengeführten PRs waren KI-generiert, ein Anstieg um das ca. 28-Fache in vierzehn Monaten, bei einer expliziten Überprüfungsrate von fast 48 %. Generierung nimmt zu, Verifizierung stagniert – diese Divergenz ist das zentrale operative Problem des Fachbereichs, und die abschließende Keynote zeigte auf die Ebene, auf der dieses Problem operationalisiert wird: das Harness, die Ebene, auf der Loops begrenzt, verifiziert und aufgezeichnet werden by construction. Begrenzt: Budgets, Schritt-Obergrenzen, Erkennung von Stillständen, sodass ein gestapelter Loop einen Worst-Case hat, der in Dollar und Seiten gemessen wird, statt in Rechnungen. Verifiziert: Evaluierungsgates im Output-Pfad, denn bei 27,6 % und steigender Tendenz muss die Überprüfung zuerst durch Maschinen und erst danach durch menschliche Aufmerksamkeit erfolgen. Aufgezeichnet: Trace-Protokolle für jeden Schritt, sodass die Frage „Was hat der Loop eigentlich getan?“ eine einfache Abfrage ist – das Prinzip „Das Log ist der Agent“, um das mehrere der meistgeteilten Vorträge der Woche kreisten. Dies ist genau der Stack, den dieser Blog seit einem Jahr im Bereich Loop Engineering, Qualitäts-Gates am Gateway, und das konkretisierte Harness-Vokabular – und die angenehme Überraschung der Woche war zu sehen, wie das Programm der Frontier-Labore selbst auf dieselbe Reihenfolge der Vorgänge zusteuert.

Die Konvergenz zeigte sich nicht nur im Programm-Raster, sondern auch darin, was die Frontier-Labore über ihre eigene Praxis sagten. In einem Bühneninterview mit swyx beschrieb Mike Krieger, Head of Labs bei Anthropic, wie sein Team den internen Agenten tatsächlich einsetzt: „Die meiste Nutzung ist tatsächlich viel stärker delegiert“, sagte er – das Instruktionsmuster lautet nicht „behebe diesen Fehler“, sondern kommt eher einer dauerhaften Verantwortung des Agenten für einen Teil der Codebasis gleich, inklusive eines Feedback-Kanals zur Überwachung und der Befugnis, Aufgaben proaktiv zu übernehmen (wie in Latent.Space's abschließendem Berichtberichtet). Liest man das als betriebliche Anforderung, ist es eine Harness-Spezifikation: Ein dauerhafter, delegierter Agent ist genau das, was Budgets vor der Ausführung, Genehmigungs-Gates für kritische Aktionen und eine schrittweise Nachverfolgung benötigt – das ist die Struktur eines gesteuerten Agent Harness -Laufs, nicht eines Chat-Fensters.

OpenAI vertritt methodisch das gleiche Argument. Der veröffentlichte „Harness Engineering“-Ansatz – über den InfoQ Anfang des Jahres berichtete – lässt Codex-Agenten ein Produktionssystem mit einer Million Zeilen unter Beobachtung, architektonischen Einschränkungen und strukturierter Dokumentation generieren, testen und bereitstellen. Reduziert man den Maßstab, bleibt die Lektion, auf die dieser Beitrag immer wieder hinauswill: Wenn die Frontier-Labore Agenten echte Systeme anvertrauen, dann durch die Stärkung der Ebene um das Modell herum, nicht durch mehr Vertrauen in das Modell selbst. Genau diese Ebene übernimmt ein Unternehmen, wenn es Agenten über ein verwaltetes Harness hinter einem kontrollierten Gateway ausführt, anstatt für jedes Team eigene Lösungen zu basteln.

Diagram: the week's arc from loops to verification to harness, mapped to the governed runtime stack.
Abbildung 1: Der Konferenzverlauf als Abhängigkeitskette. Die Zahlen basieren auf der zitierten Konferenzberichterstattung; die Angaben im unteren Bereich sind anhand der verlinkten TrueFoundry-Dokumentation überprüfbar.

Ein präziser Hinweis zu diesem unteren Bereich: Die Zeilen für Loops und Harness sind native Plattformoberflächen; die Zeile für die Verifizierung ist bewusst als Grundlagedargestellt, da TrueFoundry kein natives Eval-Produkt ausliefert. Was es liefert, ist der für die Evaluierung notwendige Standpunkt – jede Anfrage, Antwort, Kostenaufstellung und schrittweise Nachverfolgung an einem Ort –, was das Argument unseres Beitrag zur Online-LLM-Evaluierung: Qualitätsüberwachung dort, wo der Traffic bereits stattfindet. Dieselbe Reihenfolge – erst das Fundament, dann die Disziplin – gilt auch für die Loops selbst: Loop-Engineering auf Enterprise-Niveau argumentiert, dass das Design der Systeme, die Ihre Agenten steuern, Ihr Handwerk ist. Doch dieses Handwerk trifft auf die Laufzeitumgebung, die es voraussetzt – Freigaben, Budgets, Traces, verwaltete Zugangsdaten – und deren Fortsetzung im Flottenmaßstab erweitert dies auf viele Loops gleichzeitig: Orchestrierung, Routing und Resilienz, die unbeaufsichtigte Angriffsfläche sowie der Loop-Lebenszyklus auf einer verwalteten Laufzeitumgebung. Die klare Trennlinie: TrueFoundrys native, erstklassige Funktionen sind die Gateways (AI, MCP, Agent), das Agent Harness, Prompt-Management, das Skills-Register, Deployment und Fine-Tuning sowie die Governance-Kontrollen – Budgets, Quoten, RBAC, Guardrails, Traces. Online-Evaluierung und Loop-Engineering sind Disziplinen, die auf dieser Basis aufbauen, nicht deren Bestandteile.

3. Was ausgeliefert wird, inklusive der Links

Die Disziplin der Harness-Engineering-Keynote ist TrueFoundrys Agent Harness, dokumentiert und allgemein verfügbar: Agenten, die deklarativ definiert und durch einen verwalteten Plan-Act-Observe-Loop ausgeführt werden; isolierte Ausführung pro Lauf; Speicher- und Kontextverwaltung für langlebige Aufgaben; Human-in-the-Loop-Gates, die sensible Aktionen bis zur expliziten Freigabe pausieren; und die Sicherheitssäule, die in der Dokumentation kategorisch festgelegt ist – keine API-Keys oder Zugangsdaten in Agentendefinitionen, wobei die Gateways für bereichsbeschränkte Zugangsdaten, Token-Refresh und nutzerspezifische Delegation sorgen (mcp-gateway-auth-security). Der Loop-Diskurs konzentriert sich auf die dokumentierten Kontrollen des Agent Gateway– agentenspezifische Quoten und Ratenbegrenzungen, Retries, Fallbacks und Timeout-Sicherheitsmechanismen gegen blockierte oder in Endlosschleifen hängende Agenten, wobei alle Agentenaktionen protokolliert und prüfbar sind. Die Verifizierungslücke wird durch die native Telemetrie der Plattform geschlossen – schrittweise Traces mit Kosten, Token-Verbrauch und Latenz pro Schritt, die erstklassig über OpenTelemetry exportiert werden – und den Evaluierungs-Loop speisen, den Sie darauf ausführen: TrueFoundry dokumentiert Integrationen mit Evaluierungsplattformen wie Braintrust und Langfuse, und unser Online-Evaluierungs-Beitrag erläutert die Architektur im Detail. Um präzise zu sein, was nativ ist und was darauf aufbaut: Die Traces, der Export und die Guardrails sind Teil der Plattform; die Scoring-Pipeline gehört Ihnen oder einem Partner und wird an dieses Substrat angebunden – und genau diese Kombination macht aus dem 48%-Review-Problem, das bisher nach mehr Personal verlangte, ein Gate im Output-Prozess. Und die Skill-Diskussion der Woche (der „Missing Manual“-Thread aus den meistgeteilten Online-Programmierinhalten der Community) landet bei der Kompetenzregister: versionierte, zugriffsgeschützte Verfahrenspakete, die zur Laufzeit eingebunden werden und ausführlich in unserem Beitrag zu Kompetenzenbehandelt werden. Das ist das gesamte Konzept, und es ist bewusst unspektakulär: Der Stack, der auf der Frontier-Keynote vorgestellt wurde, besteht aus Dokumentationsseiten, die bereits existieren. Vergleichen Sie diese mit den Notizen zur Keynote und überzeugen Sie sich selbst.

TrueFoundry Agent Harness: the managed loop, sandbox, approvals, and traces the harness engineering keynote described — as shipped documentation
Abbildung 2: Die Keynote-Disziplin als Dokumentationsseite: verwaltete Schleifen, isolierte Ausführungen, vermittelte Anmeldedaten, Genehmigungsschleusen und schrittweise Protokollierung auf einer kontrollierten Laufzeitumgebung. Quelle: Dokumentation zum TrueFoundry Agent Harness.

Wer sollte sich dafür interessieren – jenseits der KI-Ingenieure

Schleifen, Verifizierung und Harness klingen nach Problemen für Ingenieure, und die Konferenz ist entsprechend benannt – doch jede Phase dieses Prozesses landet auch auf dem Schreibtisch anderer. Plattform- und SRE-Teams erben das Flottenproblem in dem Moment, in dem eine zweite Schleife ausgeliefert wird: Orchestrierung, Routing, Ausfallsicherheit, Skalierung. InfoSec erbt das, was im Flotten-Beitrag als unbeaufsichtigte Angriffsfläche bezeichnet wird – Agenten, die um 3 Uhr morgens mit dauerhaften Anmeldedaten agieren, sind eine Sicherheitslage, keine Demo. QA und Qualitätsmanagement erben die 27,6%-Frage: Wenn ein wachsender Anteil des zusammengeführten Codes maschinell geschrieben wird, muss die Überprüfung ebenfalls maschinell erfolgen, und jemand ist für diese Maschinerie verantwortlich. Audit erhält die Protokollierung: „Was hat die Schleife tatsächlich getan“ sollte eine abfragbare Information sein. Und die technische Leitung verantwortet den Kompromiss, der die ganze Woche über diskutiert wurde – kumulativer Output versus kumulatives Risiko – was eine Entscheidung über Budgets, Obergrenzen und Kontrollinstanzen ist, kein bloßes Bauchgefühl. Niemand von ihnen muss Agenten-Code schreiben; sie benötigen die gemeinsame Ebene – ein Gateway, Budgets, Protokolle, das allgemeiner Wortschatz – plus deren Ablage. TrueFoundry Academy ist der geführte Weg durch beides.

Der begleitende Beitrag, Unternehmensreife war der Subtext, liest sich aus der Sicht des Käufers genauso – die Führungsprogrammierung, der Analystenhintergrund und die Persona-Map –, während dieser hier die Sicht des Entwicklers einnimmt.

4. Die ehrliche Anmerkung

Zwei Kalibrierungen sorgen hier für Glaubwürdigkeit. Erstens: Das Framework verändert die Ökonomie des Scheiterns, nicht das Scheitern an sich: Begrenzte, kontrollierte und nachvollziehbare Schleifen scheitern kostengünstig und diagnostizierbar. Das ermöglicht es Teams, zu leistungsfähigen Agenten zu iterieren – aber kein Framework bringt ein schwaches Modell zum logischen Denken oder macht eine falsch konzipierte Automatisierung sinnvoll. Die Verifizierungszahlen der Woche erinnern uns daran, dass die Lücke zwischen Generierung und Absicherung durch kontinuierliche Entwicklungsarbeit geschlossen wird, nicht durch eine einzelne Ebene. Zweitens: Konferenzberichterstattung ist Berichterstattung: Die oben genannten Zitate und Zahlen stammen aus den zitierten Berichten und den Materialien der Konferenz selbst. Leser sollten die Statistiken (Greptiles 27,6 %, der 48-prozentige Bewertungsdurchschnitt) als von diesen Quellen berichtet betrachten – die Links wurden genau deshalb bereitgestellt, damit die Behauptungen nachverfolgt werden können. Was keiner Einschränkung bedarf, ist die Richtung: Eine der größten technischen KI-Konferenzen der Branche hat gerade vier Tage damit verbracht, zu argumentieren, dass das System um das Modell herum das eigentliche Produkt ist. Diesen Punkt belegt die in diesem Beitrag verlinkte Dokumentation bereits seit Langem in Form von einsatzbereiten Lösungen.

5. Häufig gestellte Fragen

Wo kann ich die hier erwähnten Vorträge ansehen? Die Konferenz veröffentlicht Aufzeichnungen auf ihrem YouTube-Kanal (youtube.com/@aiDotEngineer), wobei Keynotes live gestreamt werden und Sitzungsaufzeichnungen innerhalb weniger Tage verfügbar sind; das Programm und strukturierte Sitzungsdaten finden Sie unter ai.engineer/worldsfair/2026. Die täglichen Berichte von Latent.Space (latent.space) bieten die fundierteste Berichterstattung für Praktiker.

Unterscheidet sich „Harness Engineering“ von dem, was Agenten-Frameworks bereits tun? Ja, in Umfang und Garantien: Ein Framework ist eine Bibliothek, die Ihr Team ausführt; die Disziplin des Harness Engineering, die im Keynote-Track beschrieben wurde – und die Agent Harness implements — ist eine verwaltete Laufzeitumgebung auf kontrollierten Schienen, bei der Schleifen, Sandbox, Anmeldedaten, Gates und Traces Plattform-Eigenschaften sind. Frameworks ergänzen sie, anstatt mit ihr zu konkurrieren.

Was sollte man angesichts des Wochenverlaufs zuerst einführen? Verfolgen Sie den Bogen rückwärts: Wenn Ihre Agenten bereits Schleifen verwenden, fügen Sie das Verifizierungs-Gate (Evals im Ausgabepfad, Traces bei kontrollierten Ausführungen) hinzu, bevor Sie weitere Schleifen ergänzen — die gemeldeten Greptile/Sonar-Zahlen sind das Warnsignal. Auf der verlinkten Plattform ist das eine Konfiguration auf dem Pfad, den Ihre Aufrufe bereits nehmen, kein Umbau.

Referenzen

Zitate und Zahlen stammen aus den verlinkten Konferenzmaterialien und der Berichterstattung; zitierte Fragmente umfassen weniger als fünfzehn Wörter und sind mit Quellenangaben versehen. Statistiken entsprechen den Angaben der zitierten Quellen. Die Funktionen von TrueFoundry sind paraphrasierte Inhalte aus der verlinkten öffentlichen Dokumentation – bitte gleichen Sie diese mit der aktuellen Dokumentation ab. TrueFoundry steht in keiner Verbindung zur Konferenz; die hier dargelegte Interpretation ist die des Autors.

Haftungsausschluss. Dies ist ein unabhängiger Kommentar, der von TrueFoundry zu allgemeinen Informationszwecken veröffentlicht wurde; er stellt keine Rechts-, Finanz- oder sonstige professionelle Beratung dar. Konferenz-, Firmen- und Sprechernamen werden ausschließlich zur Identifizierung und für einen Kommentar in gutem Glauben zu öffentlichen Veranstaltungen und veröffentlichter Berichterstattung verwendet; es wird keine Verbindung, kein Sponsoring und keine Unterstützung durch die AI Engineer World's Fair, OpenAI, Anthropic oder eine der genannten Personen oder Publikationen impliziert, und keiner dieser Akteure hat diesen Artikel geprüft oder gebilligt. Zitierte Fragmente sind kurze Auszüge aus den verlinkten Quellen und werden mit Quellenangabe zu Kommentarzwecken verwendet. Die genannten Statistiken entsprechen der zitierten Berichterstattung und können sich ändern. Sollten Sie Unstimmigkeiten feststellen, kontaktieren Sie uns bitte, damit wir Korrekturen umgehend prüfen können.

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Melde dich an
Inhaltsverzeichniss

Steuern, implementieren und verfolgen Sie KI in Ihrer eigenen Infrastruktur

Buchen Sie eine 30-minütige Fahrt mit unserem KI-Experte

Eine Demo buchen

Der schnellste Weg, deine KI zu entwickeln, zu steuern und zu skalieren

Demo buchen
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Entdecke mehr

Keine Artikel gefunden.
Agentic AI in enterprises
October 8, 2026
|
Lesedauer: 5 Minuten

Wie man Agentic AI 2026 in Unternehmen einsetzt: Ein Entwurf

Keine Artikel gefunden.
What is an Agent Gateway
October 8, 2026
|
Lesedauer: 5 Minuten

Agent Gateway: Vereinheitlichung von KI-Workflows mit mehreren Agenten für Unternehmen

Keine Artikel gefunden.
October 8, 2026
|
Lesedauer: 5 Minuten

TrueFoundry und die MCP Gateway Revolution: Erkenntnisse aus dem Gartner-Bericht 2025

Keine Artikel gefunden.
October 8, 2026
|
Lesedauer: 5 Minuten

Integration von AnythingLLM mit dem AI Gateway von TrueFoundry

Keine Artikel gefunden.
Keine Artikel gefunden.

Aktuelle Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Machen Sie eine kurze Produkttour
Produkttour starten
Produkttour