Aller au contenu
Analyses
Above

TrueForge : la partie difficile des AI Agents n'est pas le Model

TrueForge de TrueFoundry est un agent runtime open source qui revendique jusqu'à 75% de coûts en moins que Claude Managed Agents. Ce qu'un harness fait réellement, ce que montre vraiment le benchmark et pourquoi c'est une bonne nouvelle pour les open models.

Par Adam Maguire Wilson11 min de lecture
Sur cette page

Demandez à une salle d'engineers ce qui rend un AI agent difficile à construire, la plupart diront le model. Demandez à des engineers qui en ont vraiment shipped un, et vous obtenez une autre liste : sessions qui survivent à un restart, tool credentials qui ne leak pas dans la sandbox, human approval step qui fonctionne à 2h du matin, context window qui ne coûte pas silencieusement dix fois votre budget. Le model est la partie que vous pouvez swap en un après-midi. La machinery autour est celle qui mange le quarter.

C'est cette machinery que TrueFoundry a open-sourcée le 19 août. TrueForge est un agent harness, la runtime layer qui fait tourner la loop autour d'un model : plan, call a tool, feed the result back, repeat, tout en gérant sessions, sandboxes, approvals et context. Le launch pitch est une alternative vendor-neutral aux Claude Managed Agents d'Anthropic à environ la moitié du operating cost, et le benchmark derrière ce pitch utilise un Chinese open model pour faire le gros du travail, ce qui est la partie la plus intéressante à mes yeux. J'ai lu le repo, l'annonce et la coverage. Voici ce qui tient.

Points clés - TrueForge est un agent harness MIT-licensed de TrueFoundry : core server exécutant agent loop, HTTP API avec TypeScript SDK et embeddable chat UI. Any model provider, any MCP server, votre infrastructure. - Headline benchmark : sur un enterprise eval de 14 tasks, TrueForge égale Claude Managed Agents en task completion pour environ 30% moins cher sur same model, et environ 75% moins cher avec GLM-5.2 au lieu d'Opus 4.8. Benchmark propre à TrueFoundry, non validé indépendamment. - Runtime est free ; le business est le gateway dessous. TrueFoundry vend governance layer, budgets, rate limits, audit, observability, traversée par chaque model/tool call. - Pour open models, histoire plus importante : neutral harness signifie que le model le moins cher qui termine task gagne workload, et la course implique de plus en plus les labs chinois. - Local mode est single process avec SQLite et sans login. Utilisez-le pour tester, pas plus.

Ce qui s'est passé

Le 19 août, TrueFoundry, startup AI infrastructure de San Francisco fondée en 2021 par d'anciens engineers Meta, a publié TrueForge sous MIT licence. La coverage a paru dans VentureBeat et InfoWorld la même semaine, et le repo a dépassé 1 800 stars en quelques jours. Key facts :

  • Harness exécute full agent execution loop : model calls, MCP tools, skills, sandboxed code execution, human approvals, context management et session state, streamed end to end.

  • Il est exposed de trois façons : bundled chat UI, HTTP API avec TypeScript SDK (@truefoundry/trueforge-sdk) et embeddable UI SDK (@truefoundry/trueforge-ui) pour mettre interface dans votre product.

  • Models viennent de YAML catalogs : OpenAI, Anthropic, Gemini et une vingtaine d'autres, plus tout OpenAI-compatible endpoint. Skills sont git-backed SKILL.md packs, convention popularisée par Claude Code.

  • Deux shapes : local mode, one process, SQLite, démarré avec npx @truefoundry/trueforge, ou hosted mode, Postgres plus Redis via Docker Compose ou Helm, pour teams.

  • Une version hosted pay-per-usage est disponible de TrueFoundry pour teams qui ne veulent pas l'opérer. NetApp et Automatiq sont nommés early users, avec internal assistant TrueFoundry.

TrueForge est un agent harness open source (MIT) publié par TrueFoundry le 19 août 2026. Il exécute agent loop, model calls, MCP tools, sandboxed execution, approvals, context management, session state, et l'expose via chat UI, HTTP API avec TypeScript SDK et embeddable UI, selon l'annonce TrueFoundry.

Pourquoi le harness est la layer qui vaut la bataille

Construire agent demo est facile. En faire tourner cinquante en production ne l'est pas, et l'écart est entièrement harness work. Model raisonne mais n'agit pas : il n'ouvrira pas file, call API, remember ce qu'il a dit trois turns plus tôt, ni se stop avant de supprimer mauvaise table. Le code de quelqu'un doit faire tout cela, répétitivement, sûrement, à coût prévisible.

Jusqu'à récemment, deux options. Construire harness vous-même, mois de plumbing et vous maintenez runtime au lieu de product, ou louer à model provider, comme Claude Managed Agents : Anthropic exécute loop, facture Claude tokens plus $0.08 per running session-hour, metered to millisecond. Deuxième option pratique et structurellement awkward. Dès que runtime, tools et billing appartiennent au même vendor, roadmap aussi.

C'est pourquoi context-engineering features comptent plus que model list. TrueForge ship subagents, deferred tool loading, tool definitions chargées seulement quand nécessaire, large-result offloading et context compaction, les astuces pour empêcher long agent run de se noyer dans history. Ce ne sont pas luxuries. Dans benchmark TrueFoundry, configuration consommait 3.8 million tokens per run contre 10 million pour Claude Managed Agents sur same tasks et same model. Même en prenant avec prudence, direction juste : most agent cost est context waste, et context handling est harness work. Même raison pour laquelle je dis à mes clients que la question intéressante dans agentic architecture est rarement quel model, mais ce qui l'entoure.

Un agent harness gère les production concerns que models ne gèrent pas : sessions, tool credentials, sandboxes, approvals, context growth. Dans benchmark TrueFoundry, harness utilise 3.8 million tokens per run contre 10 million pour Claude Managed Agents sur identical tasks, attribué à context compaction et deferred tool loading.

Le benchmark, lu attentivement

Headline number partout est 75%, donc démontons-la, car ce sont vraiment deux numbers sous un trenchcoat.

TrueFoundry a testé DevRev Enterprise-Bench, évaluation de 14 tasks couvrant systèmes CRM, issue-tracking et documents simulés. Same tasks, same tools, same model :

  • TrueForge avec Opus 4.8 Anthropic complète environ 11 sur 14 tasks à average $8.50 per run.

  • Claude Managed Agents avec same Opus 4.8 complète à peu près autant à $11.80 per run.

  • TrueForge avec GLM-5.2, open-weight model de Zhipu, complète encore à peu près autant à $2.90 per run.

Décomposition honnête : harness versus harness sur same model économise environ 30%, surtout managed-service markup plus token reduction. Passage à 75% vient aussi du changement model, Opus 4.8 vers GLM-5.2. Comparison change two variables at once, comme un write-up précis l'a noté, et dit plus sur le chemin parcouru par open models que sur TrueForge. Ce qui est en quelque sorte l'argument réel de TrueFoundry : si harness est neutre, vous êtes libre de prendre cette économie.

Deux caveats. Benchmark exécuté par TrueFoundry, pas validé indépendamment sur de plus gros production workloads. Et 14 tasks petit sample : trois tasks de noise sont différence entre bonne et mauvaise semaine. Traitez figures comme reported, pas audited.

Graphique en barres du coût moyen par run sur DevRev Enterprise-Bench. TrueForge avec Opus 4.8 a une moyenne de 8.50 dollars, Claude Managed Agents avec Opus 4.8 de 11.80 dollars, et TrueForge avec GLM-5.2 de 2.90 dollars, les trois complétant environ 11 des 14 tasks.

Même eval, trois configurations. L'économie de 30% est harness versus harness ; les 75% viennent surtout du changement model. Figures vendor-reported, reproductibles depuis benchmark directory dans le repo.

Dans benchmark propre à TrueFoundry sur Enterprise-Bench de DevRev, TrueForge égale Claude Managed Agents à environ 11 sur 14 tasks : $8.50 versus $11.80 per run sur same Opus 4.8 model, environ 30% moins, et $2.90 per run avec GLM-5.2, environ 75% moins, selon l'annonce. Results non independently validated, et figure 75% change harness et model simultanément.

Le business model n'est pas la licence

Donnez runtime, vendez layer dessous. Open-source harness est complet et vraiment free, mais TrueForge est designed pour route chaque model call et MCP interaction via AI Gateway TrueFoundry, où vivent budgets, rate limits, guardrails, access policies, observability. C'est commercial product, avec hosted pay-per-usage tier pour teams qui ne veulent pas opérer Postgres.

Ce n'est pas une critique ; même bargain que beaucoup de bonne open-source infrastructure, et pedigree Meta se voit. Founders pitch : control et convenience ne sont pas opposés si platform est bonne, et donner harness est comment mettre votre control layer sous agents de tout le monde. Robert Rubin, Senior Director Platform Engineering chez NetApp, décrit TrueFoundry comme "the central platform in IT where agentic apps and agents are routed through", exactement position que company veut own. En tant que buyer, savoir quelle layer vous engagez. Harness forkable. Gateway subscription.

Competitive set devient crowded, signe category réelle : managed runtime Anthropic côté proprietary, Deep Agents LangChain côté framework, harness MIT-licensed DeepSeek toujours developer preview, et TrueForge pour general-purpose production use. Quand three continents ship same software layer en un an, layer est load-bearing.

TrueForge est free sous MIT, mais designed pour route model/MCP traffic via commercial AI Gateway TrueFoundry, où budget enforcement, rate limits et observability sont vendus. Early adopters nommés incluent NetApp et Automatiq, selon launch coverage.

Ce que cela signifie pour open models

Voici angle que Western coverage a sous-joué. Managed runtime liée à one model family est moat pour cette family. Neutral runtime est leveller : tout workload routed through TrueForge peut être gagné par GLM-5.2, Qwen, DeepSeek ou Kimi sur cost per completed task plutôt que brand. Figure 75% existe parce que Chinese open-weight model a fini enterprise tasks à un quart du prix Opus. Il y a un an, "cheap model finished about as many tasks" n'était pas phrase écrivable sérieusement.

C'est pattern que j'observe depuis Hangzhou : open-weight labs n'ont pas à beat frontier everywhere, seulement être close enough pour que layer au-dessus cesse de care quel model est dessous. Neutral harness est cette layer, désormais open source avec governance story. Si vous pesez si open Chinese models sont prêts pour real workloads, calcul est couvert dans risk framework que j'utilise avec mes clients. Short version : "the harness treats it as just another endpoint" retire une des meilleures excuses pour ne pas tester.

Que faire maintenant

Si vous construisez ou exploitez agents, trois étapes.

  1. Aujourd'hui : exécutez npx @truefoundry/trueforge sur votre machine et connectez one model et one MCP server. Local mode est single process sur SQLite, moyen le moins cher que je connaisse pour comprendre intuitivement un harness. Gardez localhost : pas de login par défaut et docs disent clairement local mode pas internet-facing.

  2. Cette semaine : prenez one agent workload déjà en run, notez token spend et completion rate, reproduisez shape du benchmark sur vos tasks. Directory benchmark/ du repo designed pour ça. Votre number seule compte ; vendor benchmarks, celui-ci inclus, sont marketing avant rerun.

  3. Ce mois-ci : si vous payez managed-runtime prices, modelez économie harness-only 30% sur votre bill réel et testez séparément si open model passe quality bar sur same tasks. Two independent decisions, two spreadsheets. Si earlier journey et choisissez first stack, commencez avec build versus buy et self-hosting trade-offs avant tout runtime.

FAQ

Qu'est-ce qu'un agent harness ?

Runtime layer qui transforme language model en working agent. Elle exécute loop autour du model, plan, call tools, feed results back, repeat, et gère ce que model ne peut pas : session persistence, tool credentials, sandboxed execution, human approvals, context window sous contrôle sur long tasks. TrueForge, Claude Managed Agents, Deep Agents LangChain sont harnesses ; models dessous sont interchangeables à divers degrés.

TrueForge est-il free ?

Harness lui-même MIT-licensed et free, y compris commercial use. Vous payez encore : models, sandbox provider, Daytona aujourd'hui, et votre infrastructure. TrueFoundry vend governance layer optionnelle, AI Gateway avec budgets, rate limits, audit, observability, et hosted pay-per-usage pour teams qui ne veulent pas self-host.

Comment TrueForge se compare à Claude Managed Agents ?

Claude Managed Agents entièrement managed par Anthropic, billed Claude tokens plus $0.08 per running session-hour, Claude-only. TrueForge self-hosted, ou hosted TrueFoundry, model-neutral, free to run. Dans benchmark propre TrueFoundry, TrueForge égale task completion à environ 30% moins cher sur same model. Trade : vous opérez plus, benchmark vendor, pas independent.

TrueForge peut-il utiliser des open models chinois comme GLM ou Qwen ?

Oui. Supporte any OpenAI-compatible endpoint, et headline figure du benchmark vient pairing avec GLM-5.2. Cette pairing produit réduction 75%, qui dit autant sur open-model pricing que sur harness.

En bref

TrueForge a un mois, benchmark est le sien, personne ne devrait route payroll dessus. Mais shape est bonne : harness devient sa propre layer du stack, cette layer allait avoir une option neutral open-source, et le fait que launch maths s'appuie sur Chinese open model pour headline number est le signal discret de direction agent economics. Regardez si independent replications des cost claims apparaissent au prochain quarter. C'est différence entre launch et shift.

Si vous cherchez où un harness s'insère dans votre propre agent stack, c'est une conversation que j'ai régulièrement avec mes clients. Contactez-moi.

Sources

  • TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (publié 2026-08-18, consulté 2026-08-29)

  • TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (consulté 2026-08-29)

  • TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (consulté 2026-08-29)

  • VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (publié 2026-08-19, consulté 2026-08-29)

  • InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (publié 2026-08-20, consulté 2026-08-29)

  • Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (publié 2026-08-20, consulté 2026-08-29)

  • Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (publié 2026-08-19, consulté 2026-08-29)

Continuer la lecture

Agent Field Notes

Recevez le prochain numéro.

Harnesses d’agents, environnements d’exécution, sécurité et gouvernance, expliqués pour celles et ceux qui doivent exploiter ces systèmes.

Vous faites face à une décision de ce type ?

Nous réalisons des revues d'architecture, des évaluations de gouvernance et des comparaisons de frameworks à versions figées pour les équipes confrontées à des décisions déterminantes sur les systèmes d'agents.

À propos de l'auteur

Adam Maguire Wilson

Fondateur et conseiller indépendant sur les systèmes d'agents IA.

adam.mw