Blank white background with no objects or features visible.

Estamos disponibilizando acesso gratuito ao Gartner Hype Cycle for AI Governance 2026 completo. Obtenha sua cópia →

Loops, Harnesses e 6.000 engenheiros: o que a World's Fair confirmou — e o que já está disponível hoje

By Boyu Wang

Published: October 7, 2026

A AI Engineer World's Fair (AIEWF) 2026 — mais de 6.000 engenheiros, 300 palestrantes, 29 trilhas e mais de 100 parceiros de exposição ao longo de quatro dias (ai.engineer/worldsfair/2026) — é um dos retratos anuais mais claros do setor. A medição deste ano teve um formato definido. A semana começou com loops: swyx (cofundador da AIEWF) intitulou sua palestra de abertura como "Loopcraft: A Arte de Empilhar Loops", e o boletim diário de sua própria publicação destacou o veredito — "Loops, loops e mais loops" dominaram o primeiro dia completo, desde automações de cron-jobs até a agora canônica afirmação de Geoffrey Huntley de que "tudo é um loop ralph" (latent.space). O foco mudou no meio da semana para verificação, à medida que o conjunto de dados da Greptile mostrava que o código gerado por IA representava 27,6% dos PRs mesclados — um aumento em relação a menos de 1% quatorze meses antes — e a Sonar apresentou o número complementar desconfortável: cerca de 48% desse código é revisado explicitamente antes da mesclagem (conforme relatado na cobertura da conferência em chatforest.com). E encerrou com o harness: o espaço da palestra principal do último dia pertenceu à própria Harness Engineering, com o co-líder da Anthropic Labs, Mike Krieger, como destaque. Loops, verificação, harness — essa trajetória não é apenas uma programação de conferência. É uma arquitetura. E é a arquitetura que a TrueFoundry documenta e entrega hoje.

Key Takeaways

Key Takeaways

  • AIEWF 2026's arc ran loops → verification → harness: swyx opened on "Loopcraft," Greptile and Sonar quantified the verification gap mid-week, and the closing keynote belonged to Harness Engineering with Anthropic's Mike Krieger.
  • swyx's three-year retrospective named the shift outright: "the model alone is no longer the product," and prompt engineering "gave way to rigorous evals," RL environments, and context/harness engineering (dev.to).
  • The reported numbers point in the same direction: with AI writing a reported 27.6% of merged PRs and only ~48% of AI-generated code explicitly reviewed, generation has outrun verification — the gap is closed by harness infrastructure, not vigilance.
  • TrueFoundry's Agent Harness ships the keynote discipline as documentation: managed plan-act-observe loop, sandboxed execution, human-in-the-loop approval gates, memory for long-running tasks, and no credentials in agent definitions.
  • The loop discourse lands on the same surface: budgets, step ceilings, retries, and stall safeguards for governed runs — the cost half of which our Tokenmaxxing series treats end to end at the Agent Gateway are what make a stacked loop a production system instead of a token bonfire.
  • Verification ships as the continuous evaluation layer plus per-step traces — the quality gate the 48% figure says most pipelines are missing.
  • Honest note: a harness governs and bounds; it doesn't make a weak model strong or a bad task decomposition good — the frontier keynoted the layer because it changes failure economics, not because it abolishes failure.

1. A semana em três citações

Comece pela retrospectiva, pois ela dá o contexto para todo o resto. Em suas boas-vindas ao diário oficial da conferência, swyx marcou os três anos desde "A Ascensão do Engenheiro de IA" e resumiu no que a tese se tornou: todos, desde as principais startups até os laboratórios de fronteira, agora dizem que "o modelo por si só não é mais o produto", e que a engenharia de prompt "deu lugar a avaliações rigorosas", ambientes de RL para pós-treinamento e engenharia de contexto e de harness (dev.to/dailycontext). Depois, a obsessão do dia de abertura: o boletim do Latent.Space relatou que a palavra loop "dominou as conversas" — a palestra "Loopcraft" do próprio swyx estruturou a evolução da área "de chat, para ferramentas, para objetivos" até automações, e a trilha de Fábricas de Software construiu o dia em torno de loops de agentes persistentes executados contra especificações (latent.space). E o encerramento: a palestra final do dia foi sobre Engenharia de Harness — a cobertura estruturando todo o débito de quatro dias como algo "pago... através de infraestrutura, governança", com a filosofia de construção de Krieger resumida como construir "além da fronteira" (chatforest.com). Um observador da comunidade resumiu bem o ponto estrutural: três anos atrás, "Agentes de IA" era uma única trilha — este ano, o mesmo escopo precisou de nove (dev.to/hanzla). A área não ficou mais barulhenta. Ela ficou específica — e os detalhes são infraestrutura.

2. Por que o Arco é uma Arquitetura

Loops, verificação e harness não são três tópicos; eles são uma cadeia de dependência. Um loop é um agente que continua rodando — as automações de cron-job e os trabalhadores ralph-loop celebrados no dia de abertura — e um loop que continua rodando multiplica a produção além do que os humanos conseguem inspecionar, que é o que os números relatados no meio da semana apontaram: 27,6% dos PRs mesclados gerados por IA, um aumento de cerca de 28 vezes em quatorze meses, contra uma taxa de revisão explícita próxima de 48%. Geração composta, verificação estagnada — essa divergência é o principal problema operacional da área, e a palestra de encerramento apontou para a camada onde esse problema é operacionalizado: o harness, a camada onde os loops são delimitados, verificados e registrados por construção. Delimitados: orçamentos, limites de etapas, detecção de travamento, para que um loop empilhado tenha um pior cenário medido em dólares e páginas, em vez de faturas. Verificados: portões de avaliação no caminho de saída, porque, em 27,6% e subindo, a revisão precisa ser feita primeiro por máquinas e depois pela atenção humana. Registrados: rastreamentos por etapa, para que a pergunta "o que o loop realmente fez" seja uma consulta — o princípio de que o log é o agente, em torno do qual várias das palestras mais compartilhadas da semana giraram. Esta é precisamente a pilha que este blog tem documentado há um ano através de engenharia de loop,portões de qualidade no gateway, eo vocabulário de harness concretizado — e a surpresa agradável da semana foi ver o próprio programa da frontier convergir para a mesma ordem de operações.

A convergência não ocorreu apenas na grade do programa; aconteceu no que os laboratórios da frontier disseram sobre suas próprias práticas. Entrevistado no palco por swyx, o Chefe de Laboratórios da Anthropic, Mike Krieger, descreveu como sua equipe realmente utiliza seu agente interno: "A maior parte do uso é, na verdade, muito mais delegada", disse ele — o padrão de instrução não é "corrija este bug", mas algo mais próximo de dar ao agente a responsabilidade permanente por uma parte da base de código, um canal de feedback para monitorar e licença para assumir tarefas de forma proativa (conforme relatado no boletim de encerramento da Latent.Space). Leia isso como um requisito de operações e você terá uma especificação de harness: um agente permanente e delegado é precisamente o que precisa de orçamentos antes de ser executado, portões de aprovação para as ações que importam e um rastreamento passo a passo depois — que é o formato de uma Agent Harness execução governada, não de uma janela de chat.

A OpenAI tem apresentado o mesmo argumento na forma de método. Sua abordagem publicada de "Harness Engineering" — coberta pelo InfoQ no início deste ano — conta com agentes Codex gerando, testando e implantando um sistema de produção de um milhão de linhas sob observabilidade, restrições arquiteturais e documentação estruturada. Remova a escala e a lição é a que este post continua reforçando: quando a frontier confia sistemas reais a agentes, ela o faz fortalecendo a camada ao redor do modelo, e não confiando mais no modelo. Essa camada é exatamente o que uma empresa adota quando executa agentes por meio de um harness gerenciado atrás de um gateway governado, em vez de criar loops manualmente para cada equipe.

Diagram: the week's arc from loops to verification to harness, mapped to the governed runtime stack.
Figura 1: O arco da conferência como uma cadeia de dependência. Números baseados na cobertura da conferência citada; as afirmações da faixa inferior podem ser verificadas na documentação vinculada da TrueFoundry.

Uma nota de precisão sobre aquele painel inferior: as linhas de loops e harness são superfícies nativas da plataforma; a linha de verificação é deliberadamente estruturada como uma fundação, porque a TrueFoundry não oferece um produto de avaliação nativo. O que ela oferece é o ponto de vista que a avaliação precisa — cada solicitação, resposta, custo e rastreamento passo a passo em um só lugar — que é o argumento do nosso post sobre avaliação de LLM online: monitoramento de qualidade construído onde o tráfego já está. A mesma ordem de fundação seguida de disciplina se aplica aos próprios loops: Loop Engineering at Enterprise Grade defende que projetar os sistemas que orientam seus agentes é o seu ofício, mas esse ofício encontra o tempo de execução que pressupõe — aprovações, orçamentos, rastreamentos, credenciais governadas — e seu sequenciamento em escala de frota estende isso para muitos loops ao mesmo tempo: orquestração, roteamento e resiliência, a superfície de ataque não supervisionada e o ciclo de vida do loop em um tempo de execução governado. A linha a manter clara: os recursos da TrueFoundry nativa e de primeira classe são os gateways (IA, MCP, Agente), o Agent Harness, o Gerenciamento de Prompts, o Registro de Habilidades, implantação e ajuste fino, e os controles de governança — orçamentos, cotas, RBAC, guardrails, rastreamentos. A avaliação online e a engenharia de loops são disciplinas construídas sobre essa superfície, não características dela.

3. O que é entregue, com os links

A disciplina da palestra sobre Harness Engineering é o foco da TrueFoundry: Agent Harness, documentado e disponível para uso: agentes definidos de forma declarativa e executados por um loop de planejar-agir-observar gerenciado; execução em sandbox por rodada; gerenciamento de memória e contexto para tarefas de longa duração; portões de aprovação humana que pausam ações sensíveis até que haja uma autorização explícita; e o pilar de segurança declarado categoricamente na documentação — sem chaves de API ou credenciais nas definições dos agentes, com gateways intermediando credenciais com escopo definido, renovação de tokens e delegação por usuário (mcp-gateway-auth-security). O discurso sobre loops se baseia nos Gateway de Agentescontroles documentados — cotas e limites de taxa por agente, novas tentativas, fallbacks e salvaguardas de tempo limite contra agentes travados ou em loop, com todas as ações dos agentes registradas e auditáveis. A lacuna de verificação recai sobre a telemetria nativa da plataforma — rastreamentos por etapa com custo, tokens e latência por passo, exportados nativamente via OpenTelemetry — alimentando o loop de avaliação que você executa sobre ela: a TrueFoundry documenta integrações com plataformas de avaliação como Braintrust e Langfuse, e nosso post sobre avaliação online detalha a arquitetura. Para ser preciso sobre o que é nativo e o que é construído: os rastreamentos, a exportação e as guardrails vêm na plataforma; o pipeline de pontuação é seu ou de um parceiro, conectado a esse substrato — e é essa combinação que transforma o problema de revisão de 48% de um pedido de pessoal em um portão de saída de produção. E a conversa da semana sobre habilidades (o tópico do "manual que faltava" do conteúdo de programação mais compartilhado da comunidade) recai sobre o Registro de Habilidades: pacotes de procedimentos versionados e com controle de acesso montados em tempo de execução, abordados em profundidade em nosso post sobre habilidades. Esse é todo o argumento, e é deliberadamente entediante: a stack apresentada na palestra é um conjunto de páginas de documentação que já existem. Leia-as comparando com as notas da palestra e confira.

TrueFoundry Agent Harness: the managed loop, sandbox, approvals, and traces the harness engineering keynote described — as shipped documentation
Figura 2: A disciplina da palestra como uma página de documentação: loop gerenciado, execuções em sandbox, credenciais intermediadas, portões de aprovação e rastreamentos por etapa em um runtime governado. Fonte: Documentação do TrueFoundry Agent Harness.

Quem deve se importar — Além dos engenheiros de IA

Loops, verificação e harness parecem problemas de engenheiros, e a conferência tem esse nome por um motivo — mas cada estágio desse arco também vai parar na mesa de outras pessoas. Equipes de plataforma e SRE herdam o problema da frota no momento em que um segundo loop é lançado: orquestração, roteamento, resiliência, redução de escala. Segurança da Informação herda o que o post sobre frota chama de superfície de ataque não supervisionada — agentes agindo às 3 da manhã com credenciais permanentes são uma postura de segurança, não uma demonstração. QA e liderança de qualidade herdam a questão dos 27,6%: quando uma parcela crescente do código mesclado é escrita por máquinas, a revisão precisa se tornar uma máquina, e alguém é responsável por essa máquina. Auditoria obtém o rastreamento: "o que o loop realmente fez" deveria ser uma consulta. E liderança de engenharia é responsável pela negociação que a semana toda debateu — resultados que se acumulam versus riscos que se acumulam — o que é uma decisão de orçamentos, limites e controles, não uma questão de intuição. Nenhum deles precisa escrever código de agente; eles precisam da camada compartilhada — um gateway, orçamentos, rastreamentos, o vocabulário comum — além de suas prateleiras. TrueFoundry Academy é o caminho guiado através de ambos.

A publicação complementar, O subtexto era nível empresarial, lê o mesmo cenário sob a perspectiva do comprador — a programação de liderança, o contexto do analista e o mapa de personas — enquanto esta o lê sob a perspectiva do desenvolvedor.

4. A nota honesta

Duas calibrações mantêm a credibilidade disto. Primeiro, o harness altera a economia da falha, não a existência da falha: loops limitados, controlados, rastreados e com permissões falham de forma barata e diagnosticável, o que permite que as equipes iterem para agentes fortes — mas nenhum harness faz um modelo fraco raciocinar bem ou uma automação mal concebida valer a pena, e os números de verificação da própria semana são um lembrete de que a lacuna entre a geração e a garantia é fechada por engenharia sustentada, não por uma única camada. Segundo, a cobertura da conferência é apenas cobertura: as citações e números acima foram extraídos dos despachos citados e dos materiais da própria conferência, e os leitores devem tratar as estatísticas (os 27,6% da Greptile, a média de 48% de revisão) como relatadas por essas fontes — os links foram fornecidos precisamente para que as alegações possam ser rastreadas. O que não precisa de ressalvas é a direção: uma das maiores conferências técnicas de IA da área passou quatro dias argumentando que o sistema ao redor do modelo é o produto. Nesse ponto, a documentação vinculada ao longo desta publicação já vinha apresentando esse argumento na forma de produto entregue.

5. Perguntas frequentes

Onde posso assistir às palestras mencionadas aqui? A conferência publica as gravações em seu canal no YouTube (youtube.com/@aiDotEngineer), com palestras principais transmitidas ao vivo e gravações das sessões disponibilizadas em poucos dias; o programa e os dados estruturados das sessões estão em ai.engineer/worldsfair/2026. Os despachos diários do Latent.Space (latent.space) são a cobertura mais aprofundada para profissionais.

"Engenharia de harness" é diferente do que os frameworks de agentes já fazem? Sim, em escopo e garantias: um framework é uma biblioteca que sua equipe executa; a disciplina de harness que a trilha de palestras descreveu — e o Agent Harness implementa — é um runtime gerenciado em trilhos governados, onde o loop, o sandbox, as credenciais, os portões e os rastreamentos são propriedades da plataforma. Frameworks se integram a ele em vez de competir.

Qual é a primeira coisa a adotar, considerando o desenrolar da semana? Siga o arco de trás para frente: se seus agentes já fazem loops, adicione o portão de verificação (avaliações no caminho de saída, rastreamentos em execuções governadas) antes de adicionar mais loops — os números relatados pelo Greptile/Sonar são o sinal de alerta. Na plataforma vinculada, isso é uma configuração no caminho que suas chamadas já percorrem, não uma reconstrução.

Referências

Citações e números foram extraídos dos materiais e da cobertura da conferência vinculada, com fragmentos citados com menos de quinze palavras e devidamente atribuídos; as estatísticas são conforme relatadas pelas fontes citadas. As capacidades da TrueFoundry foram parafraseadas a partir da documentação pública vinculada — verifique com a documentação atual. A TrueFoundry não é afiliada à conferência; a leitura aqui apresentada é de responsabilidade do autor.

Isenção de responsabilidade. Este é um comentário independente publicado pela TrueFoundry para fins informativos gerais; não constitui aconselhamento jurídico, financeiro ou profissional. Nomes de conferências, empresas e palestrantes são usados apenas para identificação e comentário de boa-fé sobre eventos públicos e coberturas publicadas; não há qualquer afiliação, patrocínio ou endosso por parte da AI Engineer World's Fair, OpenAI, Anthropic ou de qualquer indivíduo ou publicação mencionada, e nenhum deles revisou ou endossou este artigo. Fragmentos citados são trechos curtos das fontes publicadas vinculadas, usados com atribuição para fins de comentário. As estatísticas relatadas são conforme publicadas pela cobertura citada e podem estar sujeitas a revisões. Se você acredita que algo aqui está incorreto, entre em contato conosco e analisaremos as correções prontamente.

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

No items found.
Agentic AI in enterprises
October 8, 2026
|
5 min read

Como Usar a IA Agente em Empresas em 2026: Um Plano

No items found.
What is an Agent Gateway
October 8, 2026
|
5 min read

Gateway de Agente: Unificando Fluxos de Trabalho de IA Multiagente para Empresas

No items found.
October 8, 2026
|
5 min read

TrueFoundry e a Revolução do Gateway MCP: Insights do Relatório Gartner 2025

No items found.
October 8, 2026
|
5 min read

Integrando o AnythingLLM com o AI Gateway do TrueFoundry

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour