TrueForge: Der schwierige Teil von AI Agents ist nicht das Model
TrueFoundrys TrueForge ist ein Open-Source Agent Runtime, das bis zu 75% niedrigere Kosten als Claude Managed Agents behauptet. Was ein Harness tatsächlich tut, was der Benchmark wirklich zeigt und warum das gute Nachrichten für Open Models sind.
Auf dieser Seite
- Was passiert ist
- Warum das Harness die Layer ist, um die sich der Kampf lohnt
- Der Benchmark, sorgfältig gelesen
- Das Business Model ist nicht die Licence
- Was es für Open Models bedeutet
- Was Sie jetzt tun sollten
- FAQ
- Was ist ein Agent Harness?
- Ist TrueForge free?
- Wie vergleicht sich TrueForge mit Claude Managed Agents?
- Kann TrueForge chinesische Open Models wie GLM oder Qwen verwenden?
- Fazit
- Quellen
Fragen Sie einen Raum voller Engineers, was einen AI Agent schwer zu bauen macht, und die meisten werden das Model nennen. Fragen Sie einen Raum voller Engineers, die tatsächlich einen ausgeliefert haben, und Sie bekommen eine andere Liste: Sessions, die einen Restart überleben, Tool Credentials, die nicht in die Sandbox leaken, ein Human Approval Step, der um 2 Uhr morgens funktioniert, ein Context Window, das nicht still zehnmal so viel kostet wie budgetiert. Das Model ist der Teil, den Sie an einem Nachmittag austauschen können. Die Machinery darum herum ist der Teil, der das Quartal frisst.
Diese Machinery hat TrueFoundry am 19. August open-sourced. TrueForge ist ein Agent Harness, die Runtime Layer, die den Loop um ein Model ausführt: plan, call a tool, feed the result back, repeat, während Sessions, Sandboxes, Approvals und Context entlang des Weges verwaltet werden. Der Launch Pitch ist eine vendor-neutrale Alternative zu Anthropics Claude Managed Agents bei ungefähr halben Operating Costs, und der Benchmark hinter diesem Pitch lässt ein chinesisches Open Model die schwere Arbeit machen, was ich am interessantesten finde. Ich habe das Repo, den Announcement Post und die Coverage gelesen. Hier ist, was standhält.
Wichtigste Erkenntnisse - TrueForge ist ein MIT-lizenziertes Agent Harness von TrueFoundry: ein Core Server, der den Agent Loop ausführt, eine HTTP API mit TypeScript SDK und eine embeddable Chat UI. Any Model Provider, any MCP Server, Ihre eigene Infrastructure. - Der Headline Benchmark: Auf einem 14-Task Enterprise Eval matchte TrueForge Claude Managed Agents bei Task Completion bei etwa 30% niedrigeren Kosten auf demselben Model und etwa 75% niedriger zusammen mit GLM-5.2 statt Opus 4.8. Es ist TrueFoundrys eigener Benchmark, nicht unabhängig validiert. - Die Runtime ist free; das Business ist der Gateway darunter. TrueFoundry verkauft die Governance Layer, Budgets, Rate Limits, Audit, Observability, durch die jeder Model- und Tool Call geroutet wird. - Für Open Models ist das die wichtigere Story: Ein neutrales Harness bedeutet, dass das billigste Model, das die Task beendet, den Workload gewinnt, und dieses Rennen umfasst zunehmend chinesische Labs. - Local Mode ist ein einzelner Process mit SQLite und ohne Login. Behandeln Sie ihn als Möglichkeit zum Ausprobieren, nicht mehr.
Was passiert ist
Am 19. August veröffentlichte TrueFoundry, ein 2021 von ehemaligen Meta Engineers gegründetes AI Infrastructure Startup aus San Francisco, TrueForge unter der MIT Licence. Die Launch Coverage erschien in VentureBeat und InfoWorld in derselben Woche, und das Repo überschritt innerhalb weniger Tage 1.800 Stars. Die Key Facts:
Das Harness führt den vollständigen Agent Execution Loop aus: Model Calls, MCP Tools, Skills, sandboxed Code Execution, Human Approvals, Context Management und Session State, end to end gestreamt.
Es wird auf drei Arten exposed: eine bundled Chat UI, eine HTTP API mit TypeScript SDK (
@truefoundry/trueforge-sdk) und ein embeddable UI SDK (@truefoundry/trueforge-ui) für die Integration der Interface in das eigene Product.Models kommen aus YAML Catalogs: OpenAI, Anthropic, Gemini und etwa zwanzig weitere, plus jeder OpenAI-compatible Endpoint. Skills sind git-backed
SKILL.mdPacks, dieselbe Convention, die Claude Code popularisiert hat.Es läuft in zwei Shapes: Local Mode, ein Process, SQLite, gestartet mit
npx @truefoundry/trueforge, oder Hosted Mode, Postgres plus Redis über Docker Compose oder Helm, für Teams.Eine Hosted Pay-per-usage Version ist von TrueFoundry für Teams erhältlich, die es nicht selbst betreiben wollen. NetApp und Automatiq werden als Early Users genannt, neben TrueFoundrys eigenem Internal Assistant.
TrueForge ist ein Open-Source (MIT) Agent Harness, veröffentlicht von TrueFoundry am 19. August 2026. Es führt den Agent Loop aus, Model Calls, MCP Tools, sandboxed Execution, Approvals, Context Management und Session State, und exposed ihn über Chat UI, HTTP API mit TypeScript SDK und embeddable UI, laut TrueFoundrys Announcement.
Warum das Harness die Layer ist, um die sich der Kampf lohnt
Einen Agent Demo zu bauen ist einfach. Fünfzig davon in Production zu betreiben ist es nicht, und die Lücke dazwischen ist vollständig Harness Work. Das Model reasons, aber es kann nicht handeln: Es öffnet keine Datei, ruft keine API auf, erinnert sich nicht, was es vor drei Turns gesagt hat, und stoppt sich nicht selbst, bevor es die falsche Tabelle löscht. Jemandes Code muss all das tun, wiederholt, sicher und zu vorhersehbaren Kosten.
Bis vor kurzem hatten Sie zwei Optionen. Das Harness selbst bauen, Monate Plumbing und Sie maintainen nun eine Runtime statt eines Products, oder eines von einem Model Provider mieten, was Claude Managed Agents ist: Anthropic führt den Loop für Sie aus, berechnet Claude Tokens plus $0.08 pro laufender Session-Hour, auf die Millisekunde gemessen. Die zweite Option ist bequem und strukturell awkward. Sobald Runtime, Tools und Billing einem Vendor gehören, gehört ihm auch Ihre Roadmap.
Deshalb sind die Context-engineering Features wichtiger als die Model List. TrueForge shipt Subagents, Deferred Tool Loading, Tool Definitions werden nur bei Bedarf geladen und nicht in jeden Prompt gesteckt, Large-result Offloading und Context Compaction, also all die Tricks, die verhindern, dass ein langer Agent Run in seiner eigenen History ertrinkt. Das sind keine Luxuries. In TrueFoundrys Benchmark verbrannte seine Configuration 3.8 Millionen Tokens pro Run gegenüber 10 Millionen bei Claude Managed Agents auf denselben Tasks und demselben Model. Selbst wenn man die Zahl mit Vorsicht nimmt, stimmt die Richtung: Die meisten Agent Costs sind Context Waste, und Context Handling ist Harness Work. Aus demselben Grund sage ich Clients, dass die interessante Frage in Agentic Architecture selten welches Model ist, sondern was darum herum sitzt.
Ein Agent Harness behandelt die Production Concerns, die Models nicht lösen: Sessions, Tool Credentials, Sandboxes, Approvals und Context Growth. In TrueFoundrys Benchmark nutzte sein Harness 3.8 Millionen Tokens pro Run gegenüber 10 Millionen bei Claude Managed Agents auf identischen Tasks, was es Context Compaction und Deferred Tool Loading zuschreibt.
Der Benchmark, sorgfältig gelesen
Die Headline Number überall ist 75%, also zerlegen wir sie, denn es sind wirklich zwei Zahlen in einem Trenchcoat.
TrueFoundry testete auf DevRevs Enterprise-Bench, einem 14-Task Evaluation über simulierte CRM-, Issue-tracking- und Document Systems. Same Tasks, same Tools, same Model:
TrueForge mit Anthropics Opus 4.8 erledigte etwa 11 von 14 Tasks bei durchschnittlich $8.50 pro Run.
Claude Managed Agents mit demselben Opus 4.8 erledigte ungefähr gleich viele Tasks bei $11.80 pro Run.
TrueForge mit GLM-5.2, Zhipus Open-weight Model, erledigte wiederum etwa gleich viele Tasks bei $2.90 pro Run.
Die ehrliche Zerlegung: Harness versus Harness auf demselben Model spart ungefähr 30%, hauptsächlich Managed-service Markup plus die Token Reduction oben. Der Sprung auf 75% entsteht, wenn zusätzlich das Model gewechselt wird, von Opus 4.8 zu GLM-5.2. Dieser Vergleich ändert zwei Variables gleichzeitig, wie ein scharfer Write-up feststellte, und sagt Ihnen mehr darüber, wie weit Open Models gekommen sind, als über TrueForge selbst. Das ist in gewisser Weise TrueFoundrys eigentliches Argument: Wenn das Harness neutral ist, können Sie diese Einsparung mitnehmen.
Zwei weitere Caveats. Der Benchmark wurde von TrueFoundry selbst durchgeführt und wurde auf größeren Production Workloads nicht unabhängig validiert. Und 14 Tasks sind ein kleiner Sample: Drei Tasks Noise sind der Unterschied zwischen guter und schlechter Woche. Behandeln Sie die Zahlen als reported, nicht audited.
Dasselbe Eval, drei Configurations. Die 30% Einsparung ist Harness versus Harness; die 75% kommen größtenteils vom Model Swap. Vendor-reported Figures, reproduzierbar aus dem Benchmark Directory im Repo.
In TrueFoundrys selbst ausgeführtem Benchmark auf DevRevs Enterprise-Bench matchte TrueForge Claude Managed Agents bei ungefähr 11 von 14 Tasks: $8.50 gegenüber $11.80 pro Run auf demselben Opus 4.8 Model, etwa 30% weniger, und $2.90 pro Run zusammen mit GLM-5.2, etwa 75% weniger, laut Announcement. Die Results wurden nicht unabhängig validiert, und die 75%-Zahl ändert Harness und Model gleichzeitig.
Das Business Model ist nicht die Licence
Geben Sie die Runtime gratis ab, verkaufen Sie die Layer darunter. Das Open-Source Harness ist vollständig und wirklich free, aber TrueForge ist designed, jeden Model Call und jede MCP Interaction durch TrueFoundrys AI Gateway zu routen, und im Gateway leben Budgets, Rate Limits, Guardrails, Access Policies und Observability. Das ist das Commercial Product, zusammen mit dem Hosted Pay-per-usage Tier für Teams, die Postgres nicht selbst betreiben wollen.
Ich sage das nicht als Kritik; es ist derselbe Deal wie bei viel guter Open-Source Infrastructure, und der Meta Background zeigt sich. Der Founders Pitch ist, dass Control und Convenience keine Gegensätze sind, wenn die Platform stimmt, und das Harness gratis abzugeben ist der Weg, die eigene Control Layer unter die Agents aller anderen zu bekommen. Robert Rubin, Senior Director of Platform Engineering bei NetApp, beschreibt TrueFoundry als "the central platform in IT where agentic apps and agents are routed through", genau die Position, die das Unternehmen besitzen will. Als Buyer ist es wichtig zu wissen, auf welche Layer Sie sich festlegen. Das Harness können Sie forken. Der Gateway ist Subscription.
Der Competitive Set wird crowded, was zeigt, dass die Category real ist: Anthropics Managed Runtime am proprietary Ende, LangChains Deep Agents in Framework Land, DeepSeeks eigenes MIT-lizenziertes Harness noch in Developer Preview und nun TrueForge mit Fokus auf General-purpose Production Use. Wenn drei Continents innerhalb eines Jahres dieselbe Software Layer shippen, ist die Layer load-bearing.
TrueForge ist unter MIT free, aber designed, Model- und MCP Traffic durch TrueFoundrys kommerzielles AI Gateway zu routen, wo Budget Enforcement, Rate Limits und Observability verkauft werden. Zu den beim Launch genannten Early Adopters gehören NetApp und Automatiq, laut Launch Coverage.
Was es für Open Models bedeutet
Hier ist der Angle, den die meisten Western Coverage meiner Ansicht nach unterschätzt haben. Eine Managed Runtime, die an eine Model Family gebunden ist, ist ein Moat für diese Family. Eine Neutral Runtime ist ein Leveller: Jeder Workload, der durch TrueForge geroutet wird, ist ein Workload, bei dem GLM-5.2, Qwen, DeepSeek oder Kimi nach Cost per Completed Task statt nach Brand gewinnen können. Die 75%-Zahl existiert, weil ein chinesisches Open-weight Model Enterprise Tasks zu einem Viertel des Opus Preises erledigt hat. Vor einem Jahr war "das billige Model erledigte ungefähr gleich viele Tasks" kein Satz, den man mit ernstem Gesicht schreiben konnte.
Das ist das Pattern, das ich aus Hangzhou seit einiger Zeit beobachte: Die Open-weight Labs müssen Frontier nicht überall schlagen, sie müssen nur nah genug sein, dass die Layer darüber nicht mehr darauf achtet, welches Model darunter liegt. Ein neutrales Harness ist genau diese Layer, und sie ist nun Open Source mit Governance Story. Wenn Sie abwägen, ob offene chinesische Models für reale Workloads bereit sind, ist diese Rechnung sauber in dem Risk Framework beschrieben, das ich mit Clients nutze. Kurz: "the harness treats it as just another endpoint" entfernt eine der besseren Ausreden, nicht zu testen.
Was Sie jetzt tun sollten
Wenn Sie Agents bauen oder betreiben, drei Schritte, in dieser Reihenfolge.
Heute: Führen Sie
npx @truefoundry/trueforgeauf Ihrem Rechner aus und verdrahten Sie ein Model und einen MCP Server. Local Mode ist ein einzelner Process auf SQLite, was ihn zur billigsten Art macht, Intuition dafür aufzubauen, was ein Harness tatsächlich tut. Halten Sie ihn auf localhost: Es gibt standardmäßig keinen Login, und die Docs sagen klar, dass Local Mode kein Internet-facing Setup ist.Diese Woche: Nehmen Sie einen Agent Workload, den Sie bereits betreiben, notieren Sie Token Spend und Completion Rate und reproduzieren Sie die Shape des Benchmarks auf Ihren eigenen Tasks. Das
benchmark/Directory im Repo ist genau dafür designed. Ihre Zahl ist die einzige, die zählt; Vendor Benchmarks, einschließlich dieses, sind Marketing, bis Sie sie selbst erneut ausführen.Diesen Monat: Wenn Sie Managed-runtime Preise zahlen, modellieren Sie die 30% Harness-only Einsparung gegen Ihre echte Bill und testen Sie separat, ob ein Open Model Ihre Quality Bar auf denselben Tasks erfüllt. Zwei unabhängige Decisions, zwei unabhängige Spreadsheets. Wenn Sie früher in der Journey sind und Ihren ersten Stack wählen, starten Sie mit Build versus Buy und Self-hosting Trade-offs, bevor Sie sich an eine Runtime binden.
FAQ
Was ist ein Agent Harness?
Die Runtime Layer, die ein Language Model in einen funktionierenden Agent verwandelt. Sie führt den Loop um das Model aus, plan, call tools, feed results back, repeat, und behandelt alles, was das Model nicht kann: Session Persistence, Tool Credentials, Sandboxed Execution, Human Approvals und das Context Window bei langen Tasks unter Kontrolle zu halten. TrueForge, Claude Managed Agents und LangChains Deep Agents sind alle Harnesses; die Models darunter sind in unterschiedlichem Maß austauschbar.
Ist TrueForge free?
Das Harness selbst ist MIT-lizenziert und free, auch für Commercial Use. Was Sie trotzdem bezahlen: Models, Sandbox Provider, heute Daytona, und Ihre eigene Infrastructure. TrueFoundry verkauft eine optionale Governance Layer, AI Gateway mit Budgets, Rate Limits, Audit und Observability, und eine Hosted Pay-per-usage Version für Teams, die nicht self-hosten wollen.
Wie vergleicht sich TrueForge mit Claude Managed Agents?
Claude Managed Agents wird vollständig von Anthropic gemanagt, berechnet als Claude Tokens plus $0.08 pro laufender Session-Hour und ist Claude-only. TrueForge ist self-hosted, oder von TrueFoundry hosted, model-neutral und free zu betreiben. In TrueFoundrys eigenem Benchmark matchte TrueForge die Task Completion bei etwa 30% niedrigeren Kosten auf demselben Model. Der Trade: Sie betreiben mehr selbst, und der Benchmark stammt vom Vendor, nicht von einem unabhängigen Dritten.
Kann TrueForge chinesische Open Models wie GLM oder Qwen verwenden?
Ja. Es unterstützt jeden OpenAI-compatible Endpoint, und die Headline Figure im Launch Benchmark kam aus der Kombination mit GLM-5.2. Genau diese Pairing erzeugt die 75% Cost Reduction, was genauso viel über Open-model Pricing sagt wie über das Harness.
Fazit
TrueForge ist einen Monat alt, sein Benchmark ist sein eigener, und niemand sollte Payroll darüber routen. Aber die Shape stimmt: Das Harness wird eine eigene Layer des Stacks, diese Layer musste immer eine Open-source Neutral Option bekommen, und dass die Launch Maths auf einem chinesischen Open Model beruht, um die Headline Number zu erzeugen, ist der leise Hinweis darauf, wohin Agent Economics gehen. Beobachten Sie, ob im nächsten Quarter unabhängige Replications der Cost Claims auftauchen. Das ist der Unterschied zwischen Launch und Shift.
Wenn Sie herausfinden wollen, wo ein Harness in Ihrem eigenen Agent Stack sitzt, ist das ein Gespräch, das ich regelmäßig mit Clients führe. Kontakt aufnehmen.
Quellen
TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (veröffentlicht 2026-08-18, abgerufen 2026-08-29)
TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (abgerufen 2026-08-29)
TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (abgerufen 2026-08-29)
VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (veröffentlicht 2026-08-19, abgerufen 2026-08-29)
InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (veröffentlicht 2026-08-20, abgerufen 2026-08-29)
Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (veröffentlicht 2026-08-20, abgerufen 2026-08-29)
Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (veröffentlicht 2026-08-19, abgerufen 2026-08-29)
Weiterlesen
Agent Field Notes
Die nächste Ausgabe erhalten.
Agent-Harnesses, Laufzeitumgebungen, Sicherheit und Governance – erklärt für die Menschen, die diese Systeme betreiben müssen.
Stehen Sie vor einer solchen Entscheidung?
Wir führen Architektur-Reviews, Governance-Assessments und versionsfixierte Framework-Evaluationen für Teams durch, die weitreichende Entscheidungen über Agentensysteme treffen.