TrueForge: la parte difícil de los AI Agents no es el Model
TrueForge de TrueFoundry es un agent runtime open source que afirma hasta 75% menos coste que Claude Managed Agents. Qué hace realmente un harness, qué muestra de verdad el benchmark y por qué son buenas noticias para open models.
En esta página
- Qué ocurrió
- Por qué el harness es la layer por la que vale pelear
- El benchmark, leído con cuidado
- El business model no es la licence
- Qué significa para open models
- Qué hacer ahora
- FAQ
- ¿Qué es un agent harness?
- ¿TrueForge es free?
- ¿Cómo compara TrueForge con Claude Managed Agents?
- ¿Puede TrueForge usar open models chinos como GLM o Qwen?
- En resumen
- Fuentes
Pregunta a una sala de engineers qué hace difícil construir un AI agent y la mayoría dirá el model. Pregunta a engineers que realmente han shipped uno y obtienes otra lista: sessions que sobreviven restart, tool credentials que no leak a la sandbox, human approval step que funciona a las 2am, context window que no cuesta silenciosamente diez veces lo presupuestado. El model es la parte que puedes cambiar en una tarde. La maquinaria a su alrededor es la que se come el quarter.
Esa maquinaria es lo que TrueFoundry open-sourced el 19 de agosto. TrueForge es un agent harness, la runtime layer que ejecuta el loop alrededor de un model: plan, call a tool, feed result back, repeat, gestionando sessions, sandboxes, approvals y context. El launch pitch es una alternativa vendor-neutral a Claude Managed Agents de Anthropic a aproximadamente mitad de operating cost, y el benchmark tras el pitch tiene un Chinese open model haciendo el trabajo pesado, que es la parte que más me interesa. He leído el repo, el announcement post y la coverage. Esto es lo que aguanta.
Conclusiones clave - TrueForge es un agent harness MIT-licensed de TrueFoundry: core server ejecutando agent loop, HTTP API con TypeScript SDK y embeddable chat UI. Any model provider, any MCP server, tu infraestructura. - Headline benchmark: en un enterprise eval de 14 tasks, TrueForge igualó Claude Managed Agents en task completion con cerca de 30% menos coste usando same model, y cerca de 75% menos con GLM-5.2 en lugar de Opus 4.8. Es benchmark propio de TrueFoundry, no validado independientemente. - Runtime es free; el business es gateway debajo. TrueFoundry vende governance layer, budgets, rate limits, audit, observability, por donde pasa cada model/tool call. - Para open models, esta es historia más importante: neutral harness significa que gana workload el model más barato que completa task, y esa carrera incluye cada vez más labs chinos. - Local mode es single process con SQLite y sin login. Trátalo como forma de probar, nada más.
Qué ocurrió
El 19 de agosto TrueFoundry, startup de AI infrastructure de San Francisco fundada en 2021 por ex engineers de Meta, lanzó TrueForge bajo licencia MIT. Coverage apareció en VentureBeat y InfoWorld esa semana, y el repo pasó 1.800 stars en días. Key facts:
El harness ejecuta full agent execution loop: model calls, MCP tools, skills, sandboxed code execution, human approvals, context management y session state, streamed end to end.
Se expone de tres maneras: bundled chat UI, HTTP API con TypeScript SDK (
@truefoundry/trueforge-sdk) y embeddable UI SDK (@truefoundry/trueforge-ui) para meter interface en tu product.Models vienen de YAML catalogs: OpenAI, Anthropic, Gemini y veintitantos más, además de cualquier OpenAI-compatible endpoint. Skills son git-backed
SKILL.mdpacks, misma convention popularizada por Claude Code.Corre en dos shapes: local mode, one process, SQLite, lanzado con
npx @truefoundry/trueforge, o hosted mode, Postgres plus Redis vía Docker Compose o Helm, para teams.Hay hosted pay-per-usage de TrueFoundry para teams que no quieren operarlo. NetApp y Automatiq se nombran early users, además del internal assistant de TrueFoundry.
TrueForge es un agent harness open source (MIT) lanzado por TrueFoundry el 19 de agosto de 2026. Ejecuta agent loop, model calls, MCP tools, sandboxed execution, approvals, context management, session state, y lo expone por chat UI, HTTP API con TypeScript SDK y embeddable UI, según el anuncio de TrueFoundry.
Por qué el harness es la layer por la que vale pelear
Construir agent demo es fácil. Ejecutar cincuenta en production no, y gap entre ambos es enteramente harness work. Model razona, pero no puede actuar: no abrirá file, call API, remember lo que dijo hace tres turns ni se detendrá antes de borrar la table equivocada. El code de alguien debe hacer todo eso, repetidamente, seguro y con coste predecible.
Hasta hace poco tenías dos opciones. Construir harness tú mismo, meses de plumbing y ahora mantienes runtime en vez de product, o alquilar uno de model provider, que es Claude Managed Agents: Anthropic ejecuta loop, cobra Claude tokens más $0.08 por running session-hour, metered to millisecond. Segunda opción conveniente y estructuralmente awkward. En cuanto runtime, tools y billing pertenecen a un vendor, también roadmap.
Por eso context-engineering features importan más que model list. TrueForge ship subagents, deferred tool loading, tool definitions se cargan cuando se necesitan y no se meten en cada prompt, large-result offloading y context compaction, todos trucos que evitan que long agent run se ahogue en history. No son lujos. En benchmark TrueFoundry, configuration gastó 3.8 million tokens per run frente a 10 million de Claude Managed Agents en same tasks y same model. Incluso con cautela, dirección correcta: most agent cost es context waste, context handling es harness work. Es misma razón por la que digo a clientes que pregunta interesante en agentic architecture rara vez es qué model, es qué lo envuelve.
Un agent harness maneja production concerns que models no: sessions, tool credentials, sandboxes, approvals y context growth. En benchmark de TrueFoundry, harness usó 3.8 million tokens per run versus 10 million de Claude Managed Agents en identical tasks, atribuido a context compaction y deferred tool loading.
El benchmark, leído con cuidado
Headline number en todas partes es 75%, así que desmontémoslo, porque realmente son dos numbers con gabardina.
TrueFoundry probó DevRev Enterprise-Bench, evaluación de 14 tasks en sistemas CRM, issue-tracking y documents simulados. Same tasks, same tools, same model:
TrueForge ejecutando Opus 4.8 de Anthropic completó cerca de 11 de 14 tasks a average $8.50 per run.
Claude Managed Agents con same Opus 4.8 completó aproximadamente lo mismo a $11.80 per run.
TrueForge con GLM-5.2, open-weight model de Zhipu, completó de nuevo aproximadamente lo mismo a $2.90 per run.
Descomposición honesta: harness versus harness con same model ahorra aproximadamente 30%, principalmente managed-service markup más token reduction anterior. Salto a 75% viene también de cambiar model, Opus 4.8 a GLM-5.2. Comparison cambia two variables a la vez, como señaló un write-up agudo, y te dice más de cuánto avanzaron open models que de TrueForge. Que, de alguna manera, es argumento real de TrueFoundry: si harness es neutral, eres libre de tomar ahorro.
Dos caveats más. Benchmark lo corrió TrueFoundry y no ha sido validado independientemente en production workloads mayores. Y 14 tasks es sample pequeño: tres tasks de noise separan semana buena de mala. Trata figures como reported, no audited.
Mismo eval, tres configurations. El ahorro del 30% es harness versus harness; el 75% viene principalmente de cambiar model. Figures vendor-reported, reproducibles desde benchmark directory en el repo.
En benchmark propio de TrueFoundry sobre Enterprise-Bench de DevRev, TrueForge igualó Claude Managed Agents en aproximadamente 11 de 14 tasks: $8.50 versus $11.80 per run con same Opus 4.8 model, cerca de 30% menos, y $2.90 per run con GLM-5.2, cerca de 75% menos, según el anuncio. Results no están independently validated, y figure 75% cambia harness y model a la vez.
El business model no es la licence
Regala runtime, vende layer debajo. Open-source harness es completo y realmente free, pero TrueForge está designed para route cada model call y MCP interaction por AI Gateway de TrueFoundry, y gateway es donde viven budgets, rate limits, guardrails, access policies y observability. Ese es commercial product, junto con hosted pay-per-usage tier para teams que prefieren no operar Postgres.
No lo digo como crítica; es mismo bargain que mucha good open-source infrastructure, y pedigree Meta se nota. Founders pitch: control y convenience no son opuestos si platform es correcta, y regalar harness es cómo consigues control layer debajo de agents de todos. Robert Rubin, Senior Director Platform Engineering en NetApp, describe TrueFoundry como "the central platform in IT where agentic apps and agents are routed through", exactamente position que company quiere own. Como buyer, conviene saber a qué layer te comprometes. Harness se puede fork. Gateway es subscription.
Competitive set se llena, señal de category real: managed runtime de Anthropic en proprietary end, Deep Agents de LangChain en framework land, harness MIT-licensed de DeepSeek aún developer preview, y TrueForge apuntando general-purpose production use. Cuando three continents ship same software layer en un año, layer es load-bearing.
TrueForge es free bajo MIT, pero designed para route model/MCP traffic por commercial AI Gateway de TrueFoundry, donde se venden budget enforcement, rate limits y observability. Early adopters nombrados incluyen NetApp y Automatiq, según launch coverage.
Qué significa para open models
Este es angle que creo Western coverage infravaloró. Managed runtime ligada a one model family es moat para esa family. Neutral runtime nivela: todo workload routed through TrueForge es workload donde GLM-5.2, Qwen, DeepSeek o Kimi pueden ganar por cost per completed task en vez de brand. Figure 75% existe porque Chinese open-weight model completó enterprise tasks a quarter de Opus price. Hace un año, "cheap model finished about as many tasks" no era frase escribible con cara seria.
Ese es pattern que llevo tiempo observando desde Hangzhou: open-weight labs no tienen que beat frontier everywhere, solo estar close enough para que layer de arriba deje de care qué model hay debajo. Neutral harness es exactamente esa layer, ahora open source con governance story. Si evalúas si open Chinese models están listos para real workloads, calculus está cubierto en risk framework que uso con clientes. Short version: "the harness treats it as just another endpoint" elimina una de las mejores excusas para no test.
Qué hacer ahora
Si construyes o operas agents, tres pasos, en orden.
Hoy: corre
npx @truefoundry/trueforgeen tu máquina y conecta one model y one MCP server. Local mode es single process sobre SQLite, manera más barata que conozco de desarrollar intuición de qué hace harness. Mantén localhost: no login por default, y docs son claras que local mode no es internet-facing setup.Esta semana: toma one agent workload que ya ejecutas, apunta token spend y completion rate, y reproduce shape del benchmark sobre tus tasks. Directory
benchmark/del repo está designed justo para eso. Tu number es la única que importa; vendor benchmarks, incluido este, son marketing hasta rerun.Este mes: si pagas managed-runtime prices, modela ahorro harness-only del 30% contra tu bill real y prueba por separado si open model supera quality bar en same tasks. Two independent decisions, two independent spreadsheets. Si estás earlier journey y eliges first stack, empieza con build versus buy y self-hosting trade-offs antes de comprometer runtime.
FAQ
¿Qué es un agent harness?
La runtime layer que convierte language model en working agent. Ejecuta loop alrededor del model, plan, call tools, feed results back, repeat, y maneja todo lo que model no puede: session persistence, tool credentials, sandboxed execution, human approvals y mantener context window bajo control en long tasks. TrueForge, Claude Managed Agents y Deep Agents de LangChain son harnesses; models debajo son intercambiables en grados distintos.
¿TrueForge es free?
Harness itself MIT-licensed y free, incluso commercial use. Aún pagas: models, sandbox provider, Daytona hoy, e infraestructura. TrueFoundry vende governance layer opcional, AI Gateway con budgets, rate limits, audit y observability, y hosted pay-per-usage para teams que no quieren self-host.
¿Cómo compara TrueForge con Claude Managed Agents?
Claude Managed Agents totalmente managed por Anthropic, billed como Claude tokens plus $0.08 per running session-hour, y Claude-only. TrueForge self-hosted, o hosted por TrueFoundry, model-neutral y free to run. En benchmark propio de TrueFoundry, TrueForge igualó task completion con cerca de 30% menos coste con same model. Trade: operas más tú, y benchmark es vendor, no independiente.
¿Puede TrueForge usar open models chinos como GLM o Qwen?
Sí. Soporta cualquier OpenAI-compatible endpoint, y headline figure del launch benchmark vino de pairing con GLM-5.2. Esa pairing produce cost reduction del 75%, que dice tanto sobre open-model pricing como sobre harness.
En resumen
TrueForge tiene un mes, benchmark es propio, y nadie debería route payroll por él todavía. Pero shape está bien: harness se convierte en layer propia del stack, esa layer siempre iba a tener neutral open-source option, y que launch maths dependa de Chinese open model para headline number es señal silenciosa de dónde van agent economics. Mira si aparecen independent replications de cost claims en próximo quarter. Esa es diferencia entre launch y shift.
Si intentas ubicar un harness en tu propio agent stack, es conversación que tengo regularmente con clientes. Ponte en contacto.
Fuentes
TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (publicado 2026-08-18, consultado 2026-08-29)
TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (consultado 2026-08-29)
TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (consultado 2026-08-29)
VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (publicado 2026-08-19, consultado 2026-08-29)
InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (publicado 2026-08-20, consultado 2026-08-29)
Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (publicado 2026-08-20, consultado 2026-08-29)
Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (publicado 2026-08-19, consultado 2026-08-29)
Seguir leyendo
Agent Field Notes
Recibe el próximo número.
Harnesses de agentes, entornos de ejecución, seguridad y gobernanza, explicados para quienes tienen que operar estos sistemas.
¿Te enfrentas a una decisión como esta?
Realizamos revisiones de arquitectura, evaluaciones de gobernanza y comparaciones de frameworks con versiones fijadas para equipos que toman decisiones críticas sobre sistemas de agentes.