TrueForge: a parte difícil dos AI Agents não é o Model
TrueForge da TrueFoundry é um agent runtime open source que afirma custos até 75% menores que Claude Managed Agents. O que um harness realmente faz, o que o benchmark realmente mostra e por que isso é uma boa notícia para open models.
Nesta página
- O que aconteceu
- Por que Harness é a Layer pela qual vale lutar
- Benchmark, lido com cuidado
- Business Model não é Licence
- O que significa para Open Models
- O que fazer agora
- FAQ
- O que é Agent Harness?
- TrueForge é Free?
- Como TrueForge compara com Claude Managed Agents?
- TrueForge pode usar Chinese Open Models como GLM ou Qwen?
- Resumo
- Fontes
Pergunte a uma sala de engineers o que torna um AI agent difícil de construir e a maioria dirá o model. Pergunte a engineers que realmente já shipped um e você recebe outra lista: sessions que sobrevivem a restart, tool credentials que não leak para sandbox, human approval step que funciona às 2 da manhã, context window que não custa silenciosamente dez vezes o que foi colocado no budget. Model é a parte que você pode swap em uma tarde. Machinery ao redor é a parte que come o quarter.
Foi essa machinery que TrueFoundry open-sourced em 19 de agosto. TrueForge é agent harness, runtime layer que executa loop ao redor de model: plan, call a tool, feed the result back, repeat, enquanto gerencia sessions, sandboxes, approvals e context no caminho. Launch pitch é alternativa vendor-neutral aos Claude Managed Agents da Anthropic por aproximadamente metade do operating cost, e benchmark por trás desse pitch usa um Chinese open model para heavy lifting, que é a parte que acho mais interessante. Li repo, announcement post e coverage. Aqui está o que se sustenta.
Principais conclusões - TrueForge é agent harness MIT-licensed da TrueFoundry: core server executando agent loop, HTTP API com TypeScript SDK e embeddable chat UI. Any model provider, any MCP server, sua própria infrastructure. - Headline benchmark: em enterprise eval de 14 tasks, TrueForge match Claude Managed Agents em task completion com cerca de 30% menos custo no same model, e cerca de 75% menos quando paired com GLM-5.2 em vez de Opus 4.8. É benchmark da própria TrueFoundry, não independently validated. - Runtime é free; business é gateway abaixo. TrueFoundry vende governance layer, budgets, rate limits, audit, observability, por onde cada model call e tool call passa. - Para open models, esta é a história mais importante: neutral harness significa que model mais barato que termina task ganha workload, e essa race envolve cada vez mais Chinese labs. - Local mode é single process com SQLite e sem login. Trate como forma de kick the tyres, nada além disso.
O que aconteceu
Em 19 de agosto, TrueFoundry, startup de AI infrastructure de San Francisco fundada em 2021 por former Meta engineers, lançou TrueForge sob MIT licence. Launch coverage apareceu na VentureBeat e InfoWorld na mesma semana, e repo passou 1.800 stars em poucos dias. Key facts:
Harness executa full agent execution loop: model calls, MCP tools, skills, sandboxed code execution, human approvals, context management e session state, streamed end to end.
É exposed de três maneiras: bundled chat UI, HTTP API com TypeScript SDK (
@truefoundry/trueforge-sdk) e embeddable UI SDK (@truefoundry/trueforge-ui) para colocar interface dentro do seu próprio product.Models vêm de YAML catalogs: OpenAI, Anthropic, Gemini e vinte e poucos outros, plus any OpenAI-compatible endpoint. Skills são git-backed
SKILL.mdpacks, mesma convention popularizada por Claude Code.Roda em duas shapes: local mode, one process, SQLite, iniciado com
npx @truefoundry/trueforge; ou hosted mode, Postgres plus Redis via Docker Compose ou Helm, para teams.Hosted pay-per-usage version está disponível pela TrueFoundry para teams que não querem executar tudo sozinhos. NetApp e Automatiq são named early users, ao lado do internal assistant da própria TrueFoundry.
TrueForge é open-source (MIT) agent harness lançado pela TrueFoundry em 19 de agosto de 2026. Executa agent loop, model calls, MCP tools, sandboxed execution, approvals, context management e session state, e expõe tudo por chat UI, HTTP API com TypeScript SDK e embeddable UI, segundo announcement TrueFoundry.
Por que Harness é a Layer pela qual vale lutar
Construir agent demo é fácil. Rodar cinquenta deles em production não é, e gap entre os dois é inteiramente harness work. Model reasons, mas não acts: não abre file, não call API, não remember o que disse três turns atrás e não se impede de deletar wrong table. O code de alguém tem que fazer tudo isso, repetidamente, com segurança e por um cost que você consegue prever.
Até recentemente havia duas opções. Build harness por conta própria, meses de plumbing e agora você mantém runtime em vez de product, ou rent one de model provider, que é exatamente Claude Managed Agents: Anthropic executa loop para você, billed como Claude tokens plus $0.08 per running session-hour, metered até millisecond. Segunda opção é convenient e estruturalmente awkward. No momento em que runtime, tools e billing pertencem a one vendor, roadmap também.
Por isso context-engineering features importam mais que model list. TrueForge ship subagents, deferred tool loading, tool definitions são carregadas when needed em vez de stuffed em every prompt, large-result offloading e context compaction. Todos são tricks que impedem long agent run de se afogar em own history. Não são luxuries. No benchmark TrueFoundry, configuration gastou 3.8 million tokens per run contra 10 million de Claude Managed Agents nos same tasks e same model. Mesmo tomando number com cautela, direction está certa: grande parte de agent cost é context waste e context handling é harness work. É mesma razão pela qual digo a clients que pergunta interessante em agentic architecture raramente é qual model, e sim what wraps it.
Agent harness cuida de production concerns que models não cuidam: sessions, tool credentials, sandboxes, approvals e context growth. No benchmark TrueFoundry, harness usou 3.8 million tokens per run versus 10 million de Claude Managed Agents em identical tasks, algo que TrueFoundry atribui a context compaction e deferred tool loading.
Benchmark, lido com cuidado
Headline number em todo lugar é 75%, então vamos desmontar porque na verdade são dois numbers usando mesmo trenchcoat.
TrueFoundry testou DevRev Enterprise-Bench, evaluation de 14 tasks em sistemas simulados de CRM, issue-tracking e documents. Same tasks, same tools, same model:
TrueForge rodando Opus 4.8 da Anthropic completou cerca de 11 de 14 tasks a average $8.50 per run.
Claude Managed Agents rodando same Opus 4.8 completou aproximadamente mesmo número de tasks a $11.80 per run.
TrueForge rodando GLM-5.2, open-weight model da Zhipu, novamente completou aproximadamente mesmo número de tasks a $2.90 per run.
Honest decomposition: harness versus harness no same model economiza aproximadamente 30%, principalmente managed-service markup plus token reduction acima. Jump para 75% vem porque você também troca model, de Opus 4.8 para GLM-5.2. Comparison muda two variables at once, como um write-up afiado observou, e diz mais sobre quanto open models avançaram do que sobre TrueForge em si. De certa forma, esse é argument real da TrueFoundry: se harness é neutral, você fica livre para capturar esse saving.
Duas caveats. Benchmark foi executado pela TrueFoundry e não foi independently validated em production workloads maiores. E 14 tasks é sample pequeno: noise de three tasks pode ser diferença entre good week e bad week. Trate figures como reported, não audited.
Same eval, three configurations. Saving de 30% é harness versus harness; saving de 75% vem mostly de model swap. Figures vendor-reported, reproduzíveis pelo benchmark directory no repo.
No self-run benchmark TrueFoundry em DevRev Enterprise-Bench, TrueForge match Claude Managed Agents em cerca de 11 de 14 tasks: $8.50 versus $11.80 per run no same Opus 4.8 model, cerca de 30% less, e $2.90 per run quando paired com GLM-5.2, cerca de 75% less, segundo announcement. Results não independently validated, e figure 75% muda harness e model ao mesmo tempo.
Business Model não é Licence
Give away runtime, sell layer beneath it. Open-source harness é completo e genuinely free, mas TrueForge é designed para route every model call e MCP interaction através do AI Gateway TrueFoundry. É no gateway que vivem budgets, rate limits, guardrails, access policies e observability. Esse é commercial product, junto do hosted pay-per-usage tier para teams que preferem não operar Postgres.
Não digo isso como crítica; é mesmo bargain de muita good open-source infrastructure, e Meta pedigree aparece. Pitch dos founders é que control e convenience não são opposites se platform é certa, e dar harness de graça é como colocar sua control layer debaixo dos agents de todo mundo. Robert Rubin, Senior Director of Platform Engineering na NetApp, descreve TrueFoundry como "the central platform in IT where agentic apps and agents are routed through", precisamente position que company quer own. Como buyer, vale saber em qual layer está commitment. Harness pode ser fork. Gateway é subscription.
Competitive set está crowded, o que mostra que category é real: managed runtime Anthropic no proprietary end, Deep Agents LangChain em framework land, own MIT-licensed harness DeepSeek ainda em developer preview, TrueForge mirando general-purpose production use. Quando three continents ship same software layer em um year, layer é load-bearing.
TrueForge é free sob MIT, mas designed para route model e MCP traffic pelo commercial AI Gateway TrueFoundry, onde budget enforcement, rate limits e observability são vendidos. Early adopters named no launch incluem NetApp e Automatiq, segundo launch coverage.
O que significa para Open Models
Aqui está angle que acho que Western coverage underplayed. Managed runtime tied to one model family é moat para family. Neutral runtime é leveller: every workload routed through TrueForge é workload onde GLM-5.2, Qwen, DeepSeek ou Kimi podem ganhar por cost per completed task em vez de brand. Figure 75% existe porque Chinese open-weight model terminou enterprise tasks por quarter do Opus price. Um year atrás, "cheap model finished about as many tasks" não era sentence fácil de escrever com cara séria.
É pattern que venho observando de Hangzhou: open-weight labs não precisam beat frontier everywhere, só precisam estar close enough para que layer acima pare de care qual model está underneath. Neutral harness é exatamente essa layer e agora está open source com governance story. Se está avaliando se open Chinese models estão prontos para real workloads, calculus é coberto no risk framework que uso com clients. Short version: "the harness treats it as just another endpoint" remove uma das melhores excuses para não testing.
O que fazer agora
Se você build ou run agents, três passos, em ordem.
Hoje: rode
npx @truefoundry/trueforgena machine e wire one model e one MCP server. Local mode é single process em SQLite, jeito mais barato que conheço de criar intuition sobre o que harness realmente faz. Mantenha localhost: não há login by default, e docs são diretas de que local mode não é internet-facing setup.Esta semana: pegue one agent workload que já executa, anote token spend e completion rate e reproduce shape do benchmark em own tasks. Directory
benchmark/no repo foi designed exatamente para isso. Your number é único que importa; vendor benchmarks, incluindo esse, são marketing até rerun.Este mês: se paga managed-runtime prices, modele saving harness-only de 30% contra actual bill e, separadamente, test se open model passa quality bar nos same tasks. Two independent decisions, two independent spreadsheets. Se earlier journey e escolhendo first stack, comece com build versus buy e self-hosting trade-offs antes de commit runtime.
FAQ
O que é Agent Harness?
Runtime layer que transforma language model em working agent. Executa loop ao redor do model, plan, call tools, feed results back, repeat, e cuida do que model não consegue: session persistence, tool credentials, sandboxed execution, human approvals, manter context window sob controle em long tasks. TrueForge, Claude Managed Agents e LangChain Deep Agents são harnesses; underlying models são interchangeable em graus diferentes.
TrueForge é Free?
Harness em si MIT-licensed e free, inclusive commercial use. Ainda paga models, sandbox provider, Daytona hoje, e own infrastructure. TrueFoundry vende optional governance layer, AI Gateway com budgets, rate limits, audit, observability, e hosted pay-per-usage version para teams que não querem self-host.
Como TrueForge compara com Claude Managed Agents?
Claude Managed Agents é fully managed Anthropic, billed como Claude tokens plus $0.08 per running session-hour e Claude-only. TrueForge é self-hosted, ou hosted pela TrueFoundry, model-neutral e free para run. No own benchmark da TrueFoundry, match task completion com cerca de 30% lower cost no same model. Trade: você opera mais e benchmark é vendor, não independent.
TrueForge pode usar Chinese Open Models como GLM ou Qwen?
Sim. Suporta any OpenAI-compatible endpoint, e headline figure do launch benchmark veio do pairing com GLM-5.2. Essa pairing produz 75% cost reduction, o que diz tanto sobre open-model pricing quanto harness.
Resumo
TrueForge tem um month, benchmark próprio, ninguém deveria route payroll por ele ainda. Mas shape está certa: harness está se tornando layer própria do stack, essa layer sempre teria neutral open-source option, e fato de launch maths depender de Chinese open model para produzir headline number é quiet tell sobre direção de agent economics. Observe se independent replications dos cost claims aparecem no próximo quarter. Essa é diferença entre launch e shift.
Se está tentando entender onde harness fica no own agent stack, é conversa que tenho regularmente com clients. Entre em contato.
Fontes
TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (publicado 2026-08-18, consultado 2026-08-29)
TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (consultado 2026-08-29)
TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (consultado 2026-08-29)
VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (publicado 2026-08-19, consultado 2026-08-29)
InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (publicado 2026-08-20, consultado 2026-08-29)
Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (publicado 2026-08-20, consultado 2026-08-29)
Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (publicado 2026-08-19, consultado 2026-08-29)
Continue lendo
Agent Field Notes
Receba a próxima edição.
Harnesses de agentes, ambientes de execução, segurança e governança, explicados para quem precisa operar esses sistemas.
Enfrentando uma decisão como esta?
Realizamos revisões de arquitetura, avaliações de governança e comparações de frameworks com versões fixadas para equipes que tomam decisões importantes sobre sistemas de agentes.