TrueForge: AI Agents'ın Zor Kısmı Model Değil
TrueFoundry TrueForge, Claude Managed Agents'tan %75'e kadar düşük maliyet iddia eden open-source agent runtime. Bir harness gerçekten ne yapar, benchmark aslında ne gösterir ve open models için neden iyi haber?
Bu sayfada
Bir room dolusu engineer'a AI agent build etmeyi zor yapan şeyi sorun, çoğu model der. Gerçekten bir tane shipped etmiş engineer'lara sorun, başka bir list alırsınız: restart survive eden sessions, sandbox'a leak etmeyen tool credentials, 2am'de gerçekten çalışan human approval step, budget'ın on katına quietly çıkmayan context window. Model bir afternoon'da swap edebileceğiniz parça. Etrafındaki machinery quarter'ı yiyen kısım.
TrueFoundry'nin 19 Ağustos'ta open-source ettiği şey bu machinery. TrueForge bir agent harness, model etrafındaki loop'u run eden runtime layer: plan, call a tool, feed result back, repeat; bu sırada sessions, sandboxes, approvals ve context manage eder. Launch pitch, Anthropic Claude Managed Agents'a vendor-neutral alternative ve kabaca yarı operating cost. Pitch arkasındaki benchmark'ta Chinese open model heavy lifting yapıyor, bana göre en interesting taraf da bu. Repo'yu, announcement post'u ve coverage'ı okudum. İşte ayakta kalanlar.
Temel çıkarımlar - TrueForge, TrueFoundry'nin MIT-licensed agent harness'ı: agent loop run eden core server, TypeScript SDK'lı HTTP API ve embeddable chat UI. Any model provider, any MCP server, own infrastructure. - Headline benchmark: 14-task enterprise eval'da TrueForge, Claude Managed Agents ile task completion'ı match etti, same model'de yaklaşık %30 daha düşük cost, Opus 4.8 yerine GLM-5.2 ile yaklaşık %75 daha düşük. TrueFoundry own benchmark, independently validated değil. - Runtime free; business alttaki gateway. TrueFoundry governance layer, budgets, rate limits, audit, observability satıyor, every model/tool call buradan route oluyor. - Open models için daha önemli story: neutral harness, task'i tamamlayan cheapest model'in workload'u win etmesi anlamına geliyor ve bu race giderek Chinese labs'ı içeriyor. - Local mode SQLite ile single process ve login yok. Kick the tyres yöntemi olarak treat edin, production değil.
Ne oldu
19 Ağustos'ta, eski Meta engineers tarafından 2021'de founded San Francisco AI infrastructure startup TrueFoundry, TrueForge'u MIT licence altında release etti. Aynı week VentureBeat ve InfoWorld coverage yayınladı ve repo days içinde 1,800 stars geçti. Key facts:
Harness full agent execution loop run eder: model calls, MCP tools, skills, sandboxed code execution, human approvals, context management, session state, end to end streamed.
Three surfaces: bundled chat UI, TypeScript SDK (
@truefoundry/trueforge-sdk) ile HTTP API, own product içine interface koymak için embeddable UI SDK (@truefoundry/trueforge-ui).Models YAML catalogs'tan: OpenAI, Anthropic, Gemini ve yirmi küsur provider, plus any OpenAI-compatible endpoint. Skills git-backed
SKILL.mdpacks, Claude Code'un popularise ettiği same convention.Two shapes: local mode, one process, SQLite,
npx @truefoundry/trueforge; hosted mode, Postgres plus Redis, Docker Compose veya Helm, teams için.TrueFoundry, self-host etmek istemeyen teams için hosted pay-per-usage version da sunuyor. NetApp ve Automatiq early users olarak named, TrueFoundry own internal assistant ile birlikte.
TrueForge, TrueFoundry tarafından 19 Ağustos 2026'da release edilen open-source (MIT) agent harness. Agent loop, model calls, MCP tools, sandboxed execution, approvals, context management, session state run eder ve chat UI, TypeScript SDK'lı HTTP API ve embeddable UI üzerinden expose eder, TrueFoundry announcement'a göre.
Harness neden mücadeleye değer layer
Agent demo build etmek easy. Production'da elli tane run etmek değil. İkisi arasındaki gap tamamen harness work. Model reason eder ama act edemez: file açmaz, API call etmez, üç turn önce söylediğini kendiliğinden remember etmez, wrong table delete etmeden önce kendini stop etmez. Someone's code bütün bunları repeatedly, safely ve predict edilebilir cost ile yapmak zorunda.
Yakın zamana kadar two options vardı. Harness'ı kendiniz build etmek, aylarca plumbing ve artık product yerine runtime maintain etmek, ya da model provider'dan rent etmek, Claude Managed Agents gibi. Anthropic loop'u run eder, billing Claude tokens plus $0.08 per running session-hour, millisecond'e kadar metered. İkinci option convenient ama structurally awkward. Runtime, tools ve billing one vendor'a ait olduğu moment roadmap de.
Bu yüzden context-engineering features model list'ten daha önemli. TrueForge subagents, deferred tool loading, yani tool definitions only when needed load edilir, every prompt'a stuffed edilmez, large-result offloading ve context compaction ship eder. Bunların hepsi long agent run'ın own history içinde drown olmasını engeller. Luxury değil. TrueFoundry benchmark'ta configuration 3.8 million tokens per run harcadı, Claude Managed Agents same tasks/same model'de 10 million. Number'ı pinch of salt ile alın, direction doğru: most agent cost context waste ve context handling harness work. Aynı nedenle clients'a agentic architecture içinde interesting question'ın nadiren which model, daha çok what wraps it olduğunu söylüyorum.
Agent harness, models'ın yapamadığı production concerns'ı handle eder: sessions, tool credentials, sandboxes, approvals, context growth. TrueFoundry benchmark'ta harness identical tasks üzerinde 3.8 million tokens per run kullanırken Claude Managed Agents 10 million kullandı; bunu context compaction ve deferred tool loading'e bağlıyor.
Benchmark, dikkatli okuyalım
Her yerde headline number %75, o yüzden parçalayalım; aslında trenchcoat giymiş two numbers.
TrueFoundry, DevRev Enterprise-Bench üzerinde test yaptı: simulated CRM, issue-tracking ve document systems kapsayan 14-task evaluation. Same tasks, same tools, same model:
TrueForge + Anthropic Opus 4.8 yaklaşık 11 of 14 tasks tamamladı, average $8.50 per run.
Claude Managed Agents + same Opus 4.8 yaklaşık same number, $11.80 per run.
TrueForge + GLM-5.2, Zhipu open-weight model, yine yaklaşık same number, $2.90 per run.
Honest decomposition: same model'de harness versus harness yaklaşık %30 saving, mostly managed-service markup plus yukarıdaki token reduction. %75'e jump, model'i de Opus 4.8'den GLM-5.2'ye swap ettiğiniz için geliyor. Comparison two variables at once değiştiriyor, sharp write-up bunu note etti, ve TrueForge'dan çok open models'ın ne kadar ilerlediğini anlatıyor. Bir açıdan TrueFoundry'nin real argument'ı da bu: harness neutral ise saving'i take etmekte free'siniz.
Two caveats. Benchmark TrueFoundry tarafından run edildi ve larger production workloads üzerinde independently validated değil. 14 tasks small sample; three tasks noise good week ile bad week farkı. Figures reported, not audited.
Same eval, three configurations. %30 saving harness versus harness; %75 saving mostly model swap. Vendor-reported figures, repo benchmark directory üzerinden reproducible.
TrueFoundry self-run DevRev Enterprise-Bench benchmark'ta TrueForge Claude Managed Agents'ı yaklaşık 11 of 14 tasks'te match etti: same Opus 4.8'de $8.50 versus $11.80 per run, yaklaşık %30 less; GLM-5.2 ile $2.90 per run, yaklaşık %75 less, announcement'a göre. Results independently validated değil ve %75 figure hem harness hem model değiştiriyor.
Business model licence değil
Runtime'ı give away, alttaki layer'ı sell. Open-source harness complete ve genuinely free, ama TrueForge every model call ve MCP interaction'ı TrueFoundry AI Gateway üzerinden route etmek için designed. Gateway'de budgets, rate limits, guardrails, access policies, observability var. Commercial product orası, plus hosted pay-per-usage tier.
Bunu criticism olarak söylemiyorum; good open-source infrastructure için common bargain, Meta pedigree de belli. Founders pitch, right platform varsa control ve convenience opposites değil; harness free vermek own control layer'ınızı everybody's agents altına koymanın yolu. NetApp'ten Robert Rubin TrueFoundry'yi "the central platform in IT where agentic apps and agents are routed through" diye tanımlıyor, company'nin own etmek istediği exact position. Buyer olarak hangi layer'a commit ettiğinizi bilin. Harness fork edilebilir. Gateway subscription.
Competitive set crowded oluyor, category'nin real olduğunu gösteriyor: proprietary end Anthropic managed runtime, framework land LangChain Deep Agents, DeepSeek own MIT harness developer preview'da, TrueForge general-purpose production use hedefliyor. Three continents bir year içinde same software layer ship edince layer load-bearing.
TrueForge MIT altında free, ama model/MCP traffic'i TrueFoundry commercial AI Gateway üzerinden route etmek için designed; budget enforcement, rate limits ve observability orada satılıyor. Launch'ta named early adopters NetApp ve Automatiq, launch coverage'a göre.
Open models için ne anlama geliyor
Western coverage'ın underplay ettiği angle bu. One model family'ye tied managed runtime o family için moat. Neutral runtime leveller: TrueForge üzerinden routed every workload, GLM-5.2, Qwen, DeepSeek veya Kimi'nin brand yerine cost per completed task ile win edebileceği workload. %75 number, Chinese open-weight model enterprise tasks'i Opus price'ın quarter'ında finished ettiği için var. Bir yıl önce "cheap model finished about as many tasks" serious yazılabilecek sentence değildi.
Hangzhou'dan bir süredir watch ettiğim pattern bu: open-weight labs frontier'ı everywhere beat etmek zorunda değil, layer above underlying model'i care etmeyecek kadar close enough olmaları yeter. Neutral harness exactly o layer ve şimdi open source, governance story attached. Open Chinese models real workloads için ready mi diye weigh ediyorsanız calculus clients ile kullandığım risk framework'te. Short version: "the harness treats it as just another endpoint" test etmemek için bir iyi excuse'u kaldırır.
Şimdi ne yapmalı
Agents build veya run ediyorsanız three steps, order.
Bugün: Machine'de
npx @truefoundry/trueforgerun edin, one model ve one MCP server wire edin. Local mode SQLite üzerinde single process, harness intuition build etmek için bildiğim cheapest way. Localhost'ta tutun: default login yok, docs local mode'un internet-facing setup olmadığını blunt söylüyor.Bu hafta: Already run ettiğiniz one agent workload alın, token spend ve completion rate note edin, benchmark shape'i own tasks üzerinde reproduce edin. Repo
benchmark/directory bunun için designed. Sizin number tek önemli olan; vendor benchmarks, bu dahil, siz rerun edene kadar marketing.Bu ay: Managed-runtime prices ödüyorsanız %30 harness-only saving'i actual bill üzerinde model edin ve separately open model same tasks'te quality bar'ı geçiyor mu test edin. Two independent decisions, two spreadsheets. Earlier journey ve first stack seçiyorsanız build versus buy ve self-hosting trade-offs ile başlayın.
FAQ
Agent harness nedir?
Language model'i working agent'a dönüştüren runtime layer. Model etrafında loop run eder, plan, call tools, feed results back, repeat, ve model'in yapamadığı şeyleri handle eder: session persistence, tool credentials, sandboxed execution, human approvals, long tasks'te context window control. TrueForge, Claude Managed Agents ve LangChain Deep Agents harnesses; underlying models farklı degrees'te interchangeable.
TrueForge free mi?
Harness itself MIT-licensed ve free, commercial use dahil. Yine models, sandbox provider, today Daytona, ve own infrastructure'ı ödersiniz. TrueFoundry optional governance layer, budgets/rate limits/audit/observability içeren AI Gateway ve hosted pay-per-usage version satıyor.
Claude Managed Agents ile nasıl compare?
Claude Managed Agents fully managed by Anthropic, Claude tokens plus $0.08 per running session-hour billed, Claude-only. TrueForge self-hosted veya TrueFoundry hosted, model-neutral ve runtime free. TrueFoundry own benchmark'ta same model task completion match, yaklaşık %30 lower cost. Trade: daha fazla ops sizde, benchmark vendor, independent değil.
GLM veya Qwen gibi Chinese open models kullanabilir mi?
Evet. Any OpenAI-compatible endpoint support. Launch benchmark headline figure GLM-5.2 pairing'den geldi. Pairing %75 cost reduction üretiyor, harness kadar open-model pricing hakkında da bilgi veriyor.
Sonuç
TrueForge one month old, benchmark own, kimse payroll route etmemeli. Ama shape right: harness stack'in own layer'ı oluyor, bu layer'a neutral open-source option gelecekti, ve launch maths'in headline number için Chinese open model'e dayanması agent economics direction hakkında quiet tell. Next quarter independent cost replications var mı watch edin. Launch ile shift farkı bu.
Harness own agent stack'inizde nereye sit ediyor anlamaya çalışıyorsanız, clients ile regular yaptığım conversation. İletişime geçin.
Kaynaklar
TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (yayımlanma 2026-08-18, erişim 2026-08-29)
TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (erişim 2026-08-29)
TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (erişim 2026-08-29)
VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (yayımlanma 2026-08-19, erişim 2026-08-29)
InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (yayımlanma 2026-08-20, erişim 2026-08-29)
Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (yayımlanma 2026-08-20, erişim 2026-08-29)
Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (yayımlanma 2026-08-19, erişim 2026-08-29)
Okumaya devam et
Agent Field Notes
Bir sonraki sayıyı alın.
Ajan harness’ları, çalışma zamanı ortamları, güvenlik ve yönetişim; bu sistemleri işletmek zorunda olanlar için açıklanıyor.
Buna benzer bir kararla mı karşı karşıyasınız?
Aracı sistemleri hakkında önemli kararlar alan ekipler için mimari incelemeler, yönetişim değerlendirmeleri ve sürümü sabitlenmiş çerçeve karşılaştırmaları yürütüyoruz.