Loops, Harnesses e 6.000 engenheiros: o que a World's Fair confirmou — e o que já está disponível hoje

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
A AI Engineer World's Fair (AIEWF) 2026 — mais de 6.000 engenheiros, 300 palestrantes, 29 trilhas e mais de 100 parceiros de exposição ao longo de quatro dias (ai.engineer/worldsfair/2026) — é um dos retratos anuais mais claros do setor. A medição deste ano teve um formato definido. A semana começou com loops: swyx (cofundador da AIEWF) intitulou sua palestra de abertura como "Loopcraft: A Arte de Empilhar Loops", e o boletim diário de sua própria publicação destacou o veredito — "Loops, loops e mais loops" dominaram o primeiro dia completo, desde automações de cron-jobs até a agora canônica afirmação de Geoffrey Huntley de que "tudo é um loop ralph" (latent.space). O foco mudou no meio da semana para verificação, à medida que o conjunto de dados da Greptile mostrava que o código gerado por IA representava 27,6% dos PRs mesclados — um aumento em relação a menos de 1% quatorze meses antes — e a Sonar apresentou o número complementar desconfortável: cerca de 48% desse código é revisado explicitamente antes da mesclagem (conforme relatado na cobertura da conferência em chatforest.com). E encerrou com o harness: o espaço da palestra principal do último dia pertenceu à própria Harness Engineering, com o co-líder da Anthropic Labs, Mike Krieger, como destaque. Loops, verificação, harness — essa trajetória não é apenas uma programação de conferência. É uma arquitetura. E é a arquitetura que a TrueFoundry documenta e entrega hoje.
1. A semana em três citações
Comece pela retrospectiva, pois ela dá o contexto para todo o resto. Em suas boas-vindas ao diário oficial da conferência, swyx marcou os três anos desde "A Ascensão do Engenheiro de IA" e resumiu no que a tese se tornou: todos, desde as principais startups até os laboratórios de fronteira, agora dizem que "o modelo por si só não é mais o produto", e que a engenharia de prompt "deu lugar a avaliações rigorosas", ambientes de RL para pós-treinamento e engenharia de contexto e de harness (dev.to/dailycontext). Depois, a obsessão do dia de abertura: o boletim do Latent.Space relatou que a palavra loop "dominou as conversas" — a palestra "Loopcraft" do próprio swyx estruturou a evolução da área "de chat, para ferramentas, para objetivos" até automações, e a trilha de Fábricas de Software construiu o dia em torno de loops de agentes persistentes executados contra especificações (latent.space). E o encerramento: a palestra final do dia foi sobre Engenharia de Harness — a cobertura estruturando todo o débito de quatro dias como algo "pago... através de infraestrutura, governança", com a filosofia de construção de Krieger resumida como construir "além da fronteira" (chatforest.com). Um observador da comunidade resumiu bem o ponto estrutural: três anos atrás, "Agentes de IA" era uma única trilha — este ano, o mesmo escopo precisou de nove (dev.to/hanzla). A área não ficou mais barulhenta. Ela ficou específica — e os detalhes são infraestrutura.
2. Por que o Arco é uma Arquitetura
Loops, verificação e harness não são três tópicos; eles são uma cadeia de dependência. Um loop é um agente que continua rodando — as automações de cron-job e os trabalhadores ralph-loop celebrados no dia de abertura — e um loop que continua rodando multiplica a produção além do que os humanos conseguem inspecionar, que é o que os números relatados no meio da semana apontaram: 27,6% dos PRs mesclados gerados por IA, um aumento de cerca de 28 vezes em quatorze meses, contra uma taxa de revisão explícita próxima de 48%. Geração composta, verificação estagnada — essa divergência é o principal problema operacional da área, e a palestra de encerramento apontou para a camada onde esse problema é operacionalizado: o harness, a camada onde os loops são delimitados, verificados e registrados por construção. Delimitados: orçamentos, limites de etapas, detecção de travamento, para que um loop empilhado tenha um pior cenário medido em dólares e páginas, em vez de faturas. Verificados: portões de avaliação no caminho de saída, porque, em 27,6% e subindo, a revisão precisa ser feita primeiro por máquinas e depois pela atenção humana. Registrados: rastreamentos por etapa, para que a pergunta "o que o loop realmente fez" seja uma consulta — o princípio de que o log é o agente, em torno do qual várias das palestras mais compartilhadas da semana giraram. Esta é precisamente a pilha que este blog tem documentado há um ano através de engenharia de loop,portões de qualidade no gateway, eo vocabulário de harness concretizado — e a surpresa agradável da semana foi ver o próprio programa da frontier convergir para a mesma ordem de operações.
A convergência não ocorreu apenas na grade do programa; aconteceu no que os laboratórios da frontier disseram sobre suas próprias práticas. Entrevistado no palco por swyx, o Chefe de Laboratórios da Anthropic, Mike Krieger, descreveu como sua equipe realmente utiliza seu agente interno: "A maior parte do uso é, na verdade, muito mais delegada", disse ele — o padrão de instrução não é "corrija este bug", mas algo mais próximo de dar ao agente a responsabilidade permanente por uma parte da base de código, um canal de feedback para monitorar e licença para assumir tarefas de forma proativa (conforme relatado no boletim de encerramento da Latent.Space). Leia isso como um requisito de operações e você terá uma especificação de harness: um agente permanente e delegado é precisamente o que precisa de orçamentos antes de ser executado, portões de aprovação para as ações que importam e um rastreamento passo a passo depois — que é o formato de uma Agent Harness execução governada, não de uma janela de chat.
A OpenAI tem apresentado o mesmo argumento na forma de método. Sua abordagem publicada de "Harness Engineering" — coberta pelo InfoQ no início deste ano — conta com agentes Codex gerando, testando e implantando um sistema de produção de um milhão de linhas sob observabilidade, restrições arquiteturais e documentação estruturada. Remova a escala e a lição é a que este post continua reforçando: quando a frontier confia sistemas reais a agentes, ela o faz fortalecendo a camada ao redor do modelo, e não confiando mais no modelo. Essa camada é exatamente o que uma empresa adota quando executa agentes por meio de um harness gerenciado atrás de um gateway governado, em vez de criar loops manualmente para cada equipe.

Uma nota de precisão sobre aquele painel inferior: as linhas de loops e harness são superfícies nativas da plataforma; a linha de verificação é deliberadamente estruturada como uma fundação, porque a TrueFoundry não oferece um produto de avaliação nativo. O que ela oferece é o ponto de vista que a avaliação precisa — cada solicitação, resposta, custo e rastreamento passo a passo em um só lugar — que é o argumento do nosso post sobre avaliação de LLM online: monitoramento de qualidade construído onde o tráfego já está. A mesma ordem de fundação seguida de disciplina se aplica aos próprios loops: Loop Engineering at Enterprise Grade defende que projetar os sistemas que orientam seus agentes é o seu ofício, mas esse ofício encontra o tempo de execução que pressupõe — aprovações, orçamentos, rastreamentos, credenciais governadas — e seu sequenciamento em escala de frota estende isso para muitos loops ao mesmo tempo: orquestração, roteamento e resiliência, a superfície de ataque não supervisionada e o ciclo de vida do loop em um tempo de execução governado. A linha a manter clara: os recursos da TrueFoundry nativa e de primeira classe são os gateways (IA, MCP, Agente), o Agent Harness, o Gerenciamento de Prompts, o Registro de Habilidades, implantação e ajuste fino, e os controles de governança — orçamentos, cotas, RBAC, guardrails, rastreamentos. A avaliação online e a engenharia de loops são disciplinas construídas sobre essa superfície, não características dela.
3. O que é entregue, com os links
A disciplina da palestra sobre Harness Engineering é o foco da TrueFoundry: Agent Harness, documentado e disponível para uso: agentes definidos de forma declarativa e executados por um loop de planejar-agir-observar gerenciado; execução em sandbox por rodada; gerenciamento de memória e contexto para tarefas de longa duração; portões de aprovação humana que pausam ações sensíveis até que haja uma autorização explícita; e o pilar de segurança declarado categoricamente na documentação — sem chaves de API ou credenciais nas definições dos agentes, com gateways intermediando credenciais com escopo definido, renovação de tokens e delegação por usuário (mcp-gateway-auth-security). O discurso sobre loops se baseia nos Gateway de Agentescontroles documentados — cotas e limites de taxa por agente, novas tentativas, fallbacks e salvaguardas de tempo limite contra agentes travados ou em loop, com todas as ações dos agentes registradas e auditáveis. A lacuna de verificação recai sobre a telemetria nativa da plataforma — rastreamentos por etapa com custo, tokens e latência por passo, exportados nativamente via OpenTelemetry — alimentando o loop de avaliação que você executa sobre ela: a TrueFoundry documenta integrações com plataformas de avaliação como Braintrust e Langfuse, e nosso post sobre avaliação online detalha a arquitetura. Para ser preciso sobre o que é nativo e o que é construído: os rastreamentos, a exportação e as guardrails vêm na plataforma; o pipeline de pontuação é seu ou de um parceiro, conectado a esse substrato — e é essa combinação que transforma o problema de revisão de 48% de um pedido de pessoal em um portão de saída de produção. E a conversa da semana sobre habilidades (o tópico do "manual que faltava" do conteúdo de programação mais compartilhado da comunidade) recai sobre o Registro de Habilidades: pacotes de procedimentos versionados e com controle de acesso montados em tempo de execução, abordados em profundidade em nosso post sobre habilidades. Esse é todo o argumento, e é deliberadamente entediante: a stack apresentada na palestra é um conjunto de páginas de documentação que já existem. Leia-as comparando com as notas da palestra e confira.

Quem deve se importar — Além dos engenheiros de IA
Loops, verificação e harness parecem problemas de engenheiros, e a conferência tem esse nome por um motivo — mas cada estágio desse arco também vai parar na mesa de outras pessoas. Equipes de plataforma e SRE herdam o problema da frota no momento em que um segundo loop é lançado: orquestração, roteamento, resiliência, redução de escala. Segurança da Informação herda o que o post sobre frota chama de superfície de ataque não supervisionada — agentes agindo às 3 da manhã com credenciais permanentes são uma postura de segurança, não uma demonstração. QA e liderança de qualidade herdam a questão dos 27,6%: quando uma parcela crescente do código mesclado é escrita por máquinas, a revisão precisa se tornar uma máquina, e alguém é responsável por essa máquina. Auditoria obtém o rastreamento: "o que o loop realmente fez" deveria ser uma consulta. E liderança de engenharia é responsável pela negociação que a semana toda debateu — resultados que se acumulam versus riscos que se acumulam — o que é uma decisão de orçamentos, limites e controles, não uma questão de intuição. Nenhum deles precisa escrever código de agente; eles precisam da camada compartilhada — um gateway, orçamentos, rastreamentos, o vocabulário comum — além de suas prateleiras. TrueFoundry Academy é o caminho guiado através de ambos.
A publicação complementar, O subtexto era nível empresarial, lê o mesmo cenário sob a perspectiva do comprador — a programação de liderança, o contexto do analista e o mapa de personas — enquanto esta o lê sob a perspectiva do desenvolvedor.
4. A nota honesta
Duas calibrações mantêm a credibilidade disto. Primeiro, o harness altera a economia da falha, não a existência da falha: loops limitados, controlados, rastreados e com permissões falham de forma barata e diagnosticável, o que permite que as equipes iterem para agentes fortes — mas nenhum harness faz um modelo fraco raciocinar bem ou uma automação mal concebida valer a pena, e os números de verificação da própria semana são um lembrete de que a lacuna entre a geração e a garantia é fechada por engenharia sustentada, não por uma única camada. Segundo, a cobertura da conferência é apenas cobertura: as citações e números acima foram extraídos dos despachos citados e dos materiais da própria conferência, e os leitores devem tratar as estatísticas (os 27,6% da Greptile, a média de 48% de revisão) como relatadas por essas fontes — os links foram fornecidos precisamente para que as alegações possam ser rastreadas. O que não precisa de ressalvas é a direção: uma das maiores conferências técnicas de IA da área passou quatro dias argumentando que o sistema ao redor do modelo é o produto. Nesse ponto, a documentação vinculada ao longo desta publicação já vinha apresentando esse argumento na forma de produto entregue.
5. Perguntas frequentes
Onde posso assistir às palestras mencionadas aqui? A conferência publica as gravações em seu canal no YouTube (youtube.com/@aiDotEngineer), com palestras principais transmitidas ao vivo e gravações das sessões disponibilizadas em poucos dias; o programa e os dados estruturados das sessões estão em ai.engineer/worldsfair/2026. Os despachos diários do Latent.Space (latent.space) são a cobertura mais aprofundada para profissionais.
"Engenharia de harness" é diferente do que os frameworks de agentes já fazem? Sim, em escopo e garantias: um framework é uma biblioteca que sua equipe executa; a disciplina de harness que a trilha de palestras descreveu — e o Agent Harness implementa — é um runtime gerenciado em trilhos governados, onde o loop, o sandbox, as credenciais, os portões e os rastreamentos são propriedades da plataforma. Frameworks se integram a ele em vez de competir.
Qual é a primeira coisa a adotar, considerando o desenrolar da semana? Siga o arco de trás para frente: se seus agentes já fazem loops, adicione o portão de verificação (avaliações no caminho de saída, rastreamentos em execuções governadas) antes de adicionar mais loops — os números relatados pelo Greptile/Sonar são o sinal de alerta. Na plataforma vinculada, isso é uma configuração no caminho que suas chamadas já percorrem, não uma reconstrução.
Referências
- AI Engineer World's Fair 2026 — programa, trilhas e escala: ai.engineer/worldsfair/2026; diário oficial da conferência (retrospectiva de três anos do swyx): dev.to/dailycontext; visão geral da comunidade: dev.to/hanzla.
- Latent.Space — boletim diário da AIEWF (Loopcraft, o veredito sobre loops, fábricas de software, o loop ralph de Huntley): latent.space/p/aiewf-daily-dispatch-loops.
- Cobertura da conferência dos dias 2 a 4 (Greptile 27,6% dos PRs mesclados, Sonar ~48% de média de revisão, palestra principal da Harness Engineering, enquadramento de Krieger): chatforest.com. Números conforme relatados pela cobertura.
- Documentação da TrueFoundry: Visão geral do Agent Harness,Registro de Habilidades,Autenticação e segurança do Gateway MCP,Gateway de Agentes; análises aprofundadas da série: o explicativo do Agent Harness,o glossário de agentes mapeado para a infraestrutura, e o série Tokenmaxxing.
Citações e números foram extraídos dos materiais e da cobertura da conferência vinculada, com fragmentos citados com menos de quinze palavras e devidamente atribuídos; as estatísticas são conforme relatadas pelas fontes citadas. As capacidades da TrueFoundry foram parafraseadas a partir da documentação pública vinculada — verifique com a documentação atual. A TrueFoundry não é afiliada à conferência; a leitura aqui apresentada é de responsabilidade do autor.
Isenção de responsabilidade. Este é um comentário independente publicado pela TrueFoundry para fins informativos gerais; não constitui aconselhamento jurídico, financeiro ou profissional. Nomes de conferências, empresas e palestrantes são usados apenas para identificação e comentário de boa-fé sobre eventos públicos e coberturas publicadas; não há qualquer afiliação, patrocínio ou endosso por parte da AI Engineer World's Fair, OpenAI, Anthropic ou de qualquer indivíduo ou publicação mencionada, e nenhum deles revisou ou endossou este artigo. Fragmentos citados são trechos curtos das fontes publicadas vinculadas, usados com atribuição para fins de comentário. As estatísticas relatadas são conforme publicadas pela cobertura citada e podem estar sujeitas a revisões. Se você acredita que algo aqui está incorreto, entre em contato conosco e analisaremos as correções prontamente.
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.












.webp)



.png)
.png)




.png)



.png)
.png)
.png)

.png)





