TrueForge: la parte difficile degli AI Agents non è il Model
TrueForge di TrueFoundry è un agent runtime open source che dichiara costi fino al 75% inferiori a Claude Managed Agents. Cosa fa davvero un harness, cosa mostra il benchmark e perché è una buona notizia per gli open models.
In questa pagina
- Cosa è successo
- Perché l'harness è la layer per cui vale combattere
- Il benchmark, letto con attenzione
- Il business model non è la licence
- Cosa significa per open models
- Cosa fare adesso
- FAQ
- Cos'è un agent harness?
- TrueForge è free?
- Come confronta TrueForge con Claude Managed Agents?
- TrueForge può usare open models cinesi come GLM o Qwen?
- In sintesi
- Fonti
Chiedete a una stanza di engineer cosa renda difficile costruire un AI agent e la maggior parte dirà il model. Chiedetelo a engineer che ne hanno davvero shipped uno e la lista cambia: session che sopravvivono a restart, tool credentials che non leak nella sandbox, human approval step che funziona alle 2am, context window che non costa silenziosamente dieci volte il budget. Il model è la parte che potete swap in un pomeriggio. La machinery intorno è quella che si mangia il quarter.
È quella machinery che TrueFoundry ha open-sourced il 19 agosto. TrueForge è un agent harness, la runtime layer che esegue il loop attorno a un model: plan, call a tool, feed the result back, repeat, gestendo session, sandbox, approval e context. Il launch pitch è un'alternativa vendor-neutral ai Claude Managed Agents di Anthropic a circa metà operating cost, e il benchmark dietro il pitch usa un Chinese open model per fare il lavoro pesante, la parte che trovo più interessante. Ho letto il repo, l'annuncio e la coverage. Ecco cosa regge.
Punti chiave - TrueForge è un agent harness MIT-licensed di TrueFoundry: core server che esegue l'agent loop, HTTP API con TypeScript SDK e embeddable chat UI. Any model provider, any MCP server, la vostra infrastructure. - Headline benchmark: su un enterprise eval di 14 task, TrueForge ha eguagliato Claude Managed Agents in task completion a circa 30% in meno con lo stesso model, e circa 75% in meno con GLM-5.2 invece di Opus 4.8. È il benchmark di TrueFoundry, non validato indipendentemente. - Runtime free; business è gateway sotto. TrueFoundry vende governance layer, budget, rate limit, audit, observability, attraverso cui passa ogni model/tool call. - Per open models, storia più importante: neutral harness significa che il model più economico che finisce la task vince workload, e questa gara include sempre più lab cinesi. - Local mode è single process con SQLite e senza login. Usatelo per provare, niente di più.
Cosa è successo
Il 19 agosto TrueFoundry, startup di AI infrastructure di San Francisco fondata nel 2021 da ex engineer Meta, ha rilasciato TrueForge sotto MIT licence. La coverage è uscita su VentureBeat e InfoWorld la stessa settimana, e il repo ha superato 1.800 stars in pochi giorni. Key facts:
Harness esegue full agent execution loop: model calls, MCP tools, skills, sandboxed code execution, human approvals, context management, session state, streamed end to end.
Esposto in tre modi: bundled chat UI, HTTP API con TypeScript SDK (
@truefoundry/trueforge-sdk) ed embeddable UI SDK (@truefoundry/trueforge-ui) per mettere interface nel vostro product.Models da YAML catalogs: OpenAI, Anthropic, Gemini e venti e più altri, più qualsiasi OpenAI-compatible endpoint. Skills sono git-backed
SKILL.mdpacks, stessa convention resa popolare da Claude Code.Due shapes: local mode, one process, SQLite, avviato con
npx @truefoundry/trueforge, oppure hosted mode, Postgres plus Redis via Docker Compose o Helm, per teams.Versione hosted pay-per-usage disponibile da TrueFoundry per teams che non vogliono gestirlo. NetApp e Automatiq sono nominati early users, insieme all'internal assistant di TrueFoundry.
TrueForge è un agent harness open source (MIT) rilasciato da TrueFoundry il 19 agosto 2026. Esegue agent loop, model calls, MCP tools, sandboxed execution, approvals, context management, session state, e lo espone tramite chat UI, HTTP API con TypeScript SDK ed embeddable UI, secondo l'annuncio TrueFoundry.
Perché l'harness è la layer per cui vale combattere
Costruire agent demo è facile. Farne girare cinquanta in production no, e il gap è interamente harness work. Model ragiona ma non agisce: non apre file, call API, remember cosa ha detto tre turn fa o si ferma prima di cancellare table sbagliata. Il code di qualcuno deve fare tutto, ripetutamente, in sicurezza, a costo prevedibile.
Fino a poco fa due opzioni. Costruire harness da soli, mesi di plumbing e ora mantenete runtime invece di product, oppure affittarlo da model provider, come Claude Managed Agents: Anthropic esegue loop, fattura Claude tokens più $0.08 per running session-hour, metered al millisecondo. Seconda opzione comoda ma strutturalmente awkward. Appena runtime, tools e billing appartengono a one vendor, anche roadmap.
Per questo context-engineering features contano più della model list. TrueForge ship subagents, deferred tool loading, tool definitions caricati quando servono e non infilati in ogni prompt, large-result offloading e context compaction, tutti trucchi che impediscono a long agent run di annegare nella propria history. Non sono lusso. Nel benchmark TrueFoundry, configuration ha consumato 3.8 million tokens per run contro 10 million dei Claude Managed Agents su same tasks e same model. Anche con cautela, direzione corretta: most agent cost è context waste e context handling è harness work. Stesso motivo per cui dico ai clienti che domanda interessante in agentic architecture raramente è quale model, ma cosa lo avvolge.
Un agent harness gestisce production concerns che models non gestiscono: sessions, tool credentials, sandboxes, approvals, context growth. Nel benchmark TrueFoundry, harness usa 3.8 million tokens per run contro 10 million dei Claude Managed Agents su identical tasks, attribuito a context compaction e deferred tool loading.
Il benchmark, letto con attenzione
Headline number ovunque è 75%, quindi scomponiamolo, perché sono davvero due numbers con trenchcoat.
TrueFoundry ha testato DevRev Enterprise-Bench, eval di 14 task su sistemi CRM, issue-tracking e documents simulati. Same tasks, same tools, same model:
TrueForge con Opus 4.8 Anthropic completa circa 11 di 14 task a average $8.50 per run.
Claude Managed Agents con same Opus 4.8 completa circa lo stesso numero a $11.80 per run.
TrueForge con GLM-5.2, open-weight model di Zhipu, ancora circa lo stesso numero a $2.90 per run.
Decomposizione onesta: harness versus harness su same model risparmia circa 30%, soprattutto managed-service markup più token reduction. Salto a 75% arriva cambiando anche model, da Opus 4.8 a GLM-5.2. Comparison cambia two variables at once, come ha notato un write-up acuto, e dice più su quanto open models siano avanzati che su TrueForge. Che è, in un certo senso, l'argomento vero di TrueFoundry: se harness è neutral, siete liberi di prendere quel saving.
Due caveat. Benchmark eseguito da TrueFoundry, non independently validated su production workload più grandi. E 14 task sono small sample: three tasks di noise fanno la differenza tra buona e cattiva settimana. Trattate figures come reported, non audited.
Stesso eval, tre configuration. Il saving del 30% è harness versus harness; il 75% viene soprattutto dal model swap. Figure vendor-reported, riproducibili dal benchmark directory nel repo.
Nel benchmark self-run TrueFoundry su DevRev Enterprise-Bench, TrueForge eguaglia Claude Managed Agents a circa 11 di 14 task: $8.50 versus $11.80 per run su same Opus 4.8 model, circa 30% meno, e $2.90 per run con GLM-5.2, circa 75% meno, secondo l'annuncio. Results non independently validated e figure 75% cambia harness e model insieme.
Il business model non è la licence
Regala runtime, vendi layer sotto. Open-source harness completo e davvero free, ma TrueForge è designed per route ogni model call e MCP interaction attraverso AI Gateway TrueFoundry, dove vivono budget, rate limit, guardrail, access policy, observability. Quello è commercial product, insieme al hosted pay-per-usage tier per teams che non vogliono gestire Postgres.
Non è una critica; stesso bargain di molta buona open-source infrastructure, e pedigree Meta si vede. Founders pitch: control e convenience non sono opposti se platform è giusta, e regalare harness è come mettere control layer sotto gli agents di tutti. Robert Rubin, Senior Director Platform Engineering di NetApp, descrive TrueFoundry come "the central platform in IT where agentic apps and agents are routed through", esattamente position che company vuole own. Buyer deve sapere quale layer sta adottando. Harness forkable. Gateway subscription.
Competitive set si affolla, segno che category è real: managed runtime Anthropic lato proprietary, Deep Agents LangChain in framework land, harness MIT-licensed DeepSeek ancora developer preview, TrueForge per general-purpose production use. Quando three continents ship same software layer in un anno, layer è load-bearing.
TrueForge è free sotto MIT, ma designed per route model/MCP traffic via commercial AI Gateway TrueFoundry, dove budget enforcement, rate limits e observability sono venduti. Early adopter nominati includono NetApp e Automatiq, secondo launch coverage.
Cosa significa per open models
Angle che Western coverage ha sottovalutato. Managed runtime legata a one model family è moat per quella family. Neutral runtime è leveller: every workload routed through TrueForge è workload dove GLM-5.2, Qwen, DeepSeek o Kimi possono vincere su cost per completed task invece di brand. Figure 75% esiste perché Chinese open-weight model ha finito enterprise tasks a quarter del prezzo Opus. Un anno fa, "cheap model finished about as many tasks" non era frase scrivibile seriamente.
È pattern che osservo da Hangzhou: open-weight labs non devono beat frontier everywhere, basta essere close enough perché layer sopra smetta di care quale model sta sotto. Neutral harness è esattamente quella layer, ora open source con governance story. Se state pesando se open Chinese models sono pronti per real workloads, calculus è coperto nel risk framework che uso con clienti. Short version: "the harness treats it as just another endpoint" rimuove una delle migliori scuse per non testare.
Cosa fare adesso
Se buildate o operate agents, tre step in ordine.
Oggi: eseguite
npx @truefoundry/trueforgesulla macchina e collegate one model e one MCP server. Local mode è single process su SQLite, modo più economico che conosco per capire harness. Tenetelo localhost: no login by default, docs chiare che local mode non è internet-facing.Questa settimana: prendete one agent workload già in esecuzione, annotate token spend e completion rate, riproducete shape del benchmark sulle vostre task. Directory
benchmark/del repo designed per questo. Il vostro number è l'unico importante; vendor benchmarks sono marketing finché non li rerun.Questo mese: se pagate managed-runtime prices, modellate saving harness-only 30% sulla bill reale e testate separatamente se open model supera quality bar su same tasks. Two independent decisions, two spreadsheets. Se earlier journey e scegliete first stack, partite da build versus buy e self-hosting trade-offs.
FAQ
Cos'è un agent harness?
Runtime layer che trasforma language model in working agent. Esegue loop intorno al model, plan, call tools, feed results back, repeat, e gestisce ciò che model non può: session persistence, tool credentials, sandboxed execution, human approvals, context window sotto controllo. TrueForge, Claude Managed Agents, Deep Agents LangChain sono harnesses; models sotto sono intercambiabili in varia misura.
TrueForge è free?
Harness stesso MIT-licensed e free, anche commercial use. Pagate ancora models, sandbox provider, Daytona oggi, e infrastructure. TrueFoundry vende governance layer opzionale, AI Gateway con budget, rate limit, audit, observability, e hosted pay-per-usage per teams che non vogliono self-host.
Come confronta TrueForge con Claude Managed Agents?
Claude Managed Agents fully managed Anthropic, billed Claude tokens plus $0.08 per running session-hour, Claude-only. TrueForge self-hosted o hosted TrueFoundry, model-neutral e free to run. Nel benchmark TrueFoundry, eguaglia task completion a circa 30% meno con same model. Trade: operate più voi, benchmark vendor non independent.
TrueForge può usare open models cinesi come GLM o Qwen?
Sì. Supporta ogni OpenAI-compatible endpoint, e headline figure del benchmark viene dal pairing con GLM-5.2. Quello produce il 75% cost reduction, dicendo tanto su open-model pricing quanto sull'harness.
In sintesi
TrueForge ha un mese, benchmark è proprio, nessuno dovrebbe route payroll su di lui. Ma shape giusta: harness diventa layer propria stack, doveva arrivare neutral open-source option, e launch maths che usa Chinese open model per headline number è segnale silenzioso di dove vanno agent economics. Guardate se independent replications dei cost claims arrivano nel prossimo quarter. Differenza tra launch e shift.
Se state cercando dove harness siede nel vostro agent stack, è conversazione che faccio regolarmente con clienti. Contattatemi.
Fonti
TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (pubblicato 2026-08-18, consultato 2026-08-29)
TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (consultato 2026-08-29)
TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (consultato 2026-08-29)
VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (pubblicato 2026-08-19, consultato 2026-08-29)
InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (pubblicato 2026-08-20, consultato 2026-08-29)
Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (pubblicato 2026-08-20, consultato 2026-08-29)
Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (pubblicato 2026-08-19, consultato 2026-08-29)
Continua a leggere
Agent Field Notes
Ricevi il prossimo numero.
Harness per agenti, runtime, sicurezza e governance, spiegati per chi deve gestire questi sistemi.
State affrontando una decisione come questa?
Realizziamo revisioni di architettura, valutazioni di governance e comparazioni di framework con versioni bloccate per team che prendono decisioni cruciali sui sistemi di agenti.