Lewati ke konten
Analisis
Above

TrueForge: Bagian Sulit AI Agents Bukan Model

TrueForge dari TrueFoundry adalah agent runtime open source yang mengklaim biaya hingga 75% lebih rendah daripada Claude Managed Agents. Apa yang sebenarnya dilakukan harness, apa yang benar-benar ditunjukkan benchmark, dan mengapa ini kabar baik bagi open models.

Oleh Adam Maguire WilsonBaca 11 mnt
Di halaman ini

Tanya satu ruangan penuh engineers apa yang membuat AI agent sulit dibangun, dan kebanyakan akan menjawab model. Tanya engineers yang benar-benar pernah ship satu, dan daftar yang muncul berbeda: sessions yang tetap hidup setelah restart, tool credentials yang tidak leak ke sandbox, human approval step yang tetap bekerja pukul 2 pagi, context window yang tidak diam-diam menelan biaya sepuluh kali budget. Model adalah bagian yang bisa Anda swap dalam satu sore. Machinery di sekelilingnya adalah bagian yang menghabiskan satu quarter.

Machinery itulah yang di-open-source TrueFoundry pada 19 Agustus. TrueForge adalah agent harness, runtime layer yang menjalankan loop di sekitar model: plan, call a tool, feed the result back, repeat, sambil mengelola sessions, sandboxes, approvals, dan context di sepanjang jalan. Launch pitch-nya adalah alternatif vendor-neutral terhadap Claude Managed Agents milik Anthropic dengan operating cost kira-kira setengahnya, dan benchmark di balik pitch itu menggunakan Chinese open model untuk heavy lifting. Justru bagian itu yang paling menarik bagi saya. Saya sudah membaca repo, announcement post, dan coverage. Berikut bagian yang benar-benar bertahan saat dibaca lebih dekat.

Poin utama - TrueForge adalah agent harness MIT-licensed dari TrueFoundry: core server yang menjalankan agent loop, HTTP API dengan TypeScript SDK, dan embeddable chat UI. Any model provider, any MCP server, infrastructure Anda sendiri. - Headline benchmark: pada enterprise eval 14 task, TrueForge match Claude Managed Agents dalam task completion dengan biaya sekitar 30% lebih rendah pada same model, dan sekitar 75% lebih rendah ketika dipasangkan dengan GLM-5.2 alih-alih Opus 4.8. Ini benchmark TrueFoundry sendiri, belum independently validated. - Runtime gratis; business-nya adalah gateway di bawahnya. TrueFoundry menjual governance layer, budgets, rate limits, audit, observability, yang dilewati setiap model call dan tool call. - Untuk open models, ini cerita yang lebih penting: neutral harness berarti model termurah yang berhasil menyelesaikan task memenangkan workload, dan race itu sekarang semakin melibatkan Chinese labs. - Local mode adalah single process dengan SQLite dan tanpa login. Perlakukan sebagai cara untuk kick the tyres, bukan lebih dari itu.

Apa yang terjadi

Pada 19 Agustus, TrueFoundry, startup AI infrastructure San Francisco yang founded pada 2021 oleh mantan engineers Meta, merilis TrueForge di bawah MIT licence. Launch coverage muncul di VentureBeat dan InfoWorld pada minggu yang sama, dan repo melewati 1.800 stars dalam hitungan hari. Key facts:

  • Harness menjalankan full agent execution loop: model calls, MCP tools, skills, sandboxed code execution, human approvals, context management, dan session state, semuanya streamed end to end.

  • Ia diekspos dengan tiga cara: bundled chat UI, HTTP API dengan TypeScript SDK (@truefoundry/trueforge-sdk), dan embeddable UI SDK (@truefoundry/trueforge-ui) untuk memasukkan interface ke product Anda sendiri.

  • Models datang dari YAML catalogs: OpenAI, Anthropic, Gemini, dan sekitar dua puluh provider lain, plus any OpenAI-compatible endpoint. Skills adalah git-backed SKILL.md packs, convention yang dipopulerkan Claude Code.

  • Ia berjalan dalam dua bentuk: local mode, one process, SQLite, dimulai dengan npx @truefoundry/trueforge, atau hosted mode, Postgres plus Redis via Docker Compose atau Helm, untuk teams.

  • Hosted pay-per-usage version tersedia dari TrueFoundry bagi teams yang tidak ingin mengoperasikannya sendiri. NetApp dan Automatiq disebut sebagai early users, bersama internal assistant milik TrueFoundry.

TrueForge adalah open-source (MIT) agent harness yang dirilis TrueFoundry pada 19 Agustus 2026. Ia menjalankan agent loop, model calls, MCP tools, sandboxed execution, approvals, context management, session state, lalu mengeksposnya melalui chat UI, HTTP API dengan TypeScript SDK, dan embeddable UI, menurut announcement TrueFoundry.

Mengapa harness adalah layer yang layak diperebutkan

Membangun agent demo itu mudah. Menjalankan lima puluh di production tidak, dan gap di antara keduanya sepenuhnya adalah harness work. Model bisa reason, tetapi tidak bisa act: ia tidak akan membuka file, memanggil API, mengingat apa yang dikatakan tiga turns lalu, atau menghentikan dirinya sendiri sebelum menghapus table yang salah. Code milik seseorang harus melakukan semua itu, berulang kali, dengan aman, dan dengan cost yang bisa diprediksi.

Sampai baru-baru ini Anda punya dua pilihan. Build harness sendiri, menghabiskan berbulan-bulan untuk plumbing dan akhirnya maintain runtime alih-alih product, atau menyewa dari model provider, seperti Claude Managed Agents. Anthropic menjalankan loop untuk Anda, lalu billing berupa Claude tokens plus $0.08 per running session-hour, metered sampai millisecond. Pilihan kedua convenient tetapi secara struktural awkward. Begitu runtime, tools, dan billing semuanya milik one vendor, roadmap Anda ikut menjadi miliknya.

Ini juga mengapa context-engineering features lebih penting daripada model list. TrueForge ship subagents, deferred tool loading, tool definitions dimuat saat dibutuhkan, bukan dimasukkan ke setiap prompt, large-result offloading, dan context compaction. Semua itu adalah tricks untuk mencegah long agent run tenggelam dalam history sendiri. Itu bukan luxury. Dalam benchmark TrueFoundry, configuration mereka menghabiskan 3.8 million tokens per run dibanding 10 million untuk Claude Managed Agents pada same tasks dan same model. Walau number itu tetap perlu dibaca hati-hati, arah besarnya masuk akal: banyak biaya agent adalah context waste, dan context handling adalah harness work. Itu alasan yang sama saya katakan kepada clients bahwa pertanyaan interesting dalam agentic architecture jarang "model yang mana", melainkan "apa yang membungkusnya".

Agent harness menangani production concerns yang model tidak bisa: sessions, tool credentials, sandboxes, approvals, dan context growth. Dalam benchmark TrueFoundry, harness-nya memakai 3.8 million tokens per run versus 10 million untuk Claude Managed Agents pada identical tasks, yang dikaitkan dengan context compaction dan deferred tool loading.

Benchmark, dibaca dengan hati-hati

Headline number di mana-mana adalah 75%, jadi mari bongkar, karena sebenarnya itu dua numbers yang memakai trenchcoat yang sama.

TrueFoundry menguji DevRev Enterprise-Bench, evaluation 14 task yang mencakup simulated CRM, issue-tracking, dan document systems. Same tasks, same tools, same model:

  • TrueForge menjalankan Opus 4.8 milik Anthropic menyelesaikan sekitar 11 dari 14 tasks dengan average $8.50 per run.

  • Claude Managed Agents menjalankan same Opus 4.8 menyelesaikan kira-kira jumlah task yang sama dengan $11.80 per run.

  • TrueForge menjalankan GLM-5.2, open-weight model dari Zhipu, kembali menyelesaikan kira-kira jumlah task yang sama dengan $2.90 per run.

Jadi decomposisi yang jujur: harness versus harness pada same model menghemat sekitar 30%, terutama managed-service markup plus token reduction di atas. Lompatan ke 75% muncul karena Anda juga mengganti model, dari Opus 4.8 ke GLM-5.2. Comparison itu mengubah dua variables sekaligus, seperti dicatat satu write-up yang tajam, dan ia memberi tahu lebih banyak tentang seberapa jauh open models telah berkembang daripada tentang TrueForge sendiri. Dalam satu sisi, justru itu argument TrueFoundry: jika harness neutral, Anda bebas mengambil saving tersebut.

Dua caveats lagi. Benchmark dijalankan TrueFoundry sendiri dan belum independently validated pada production workloads yang lebih besar. Dan 14 tasks adalah sample kecil: noise tiga tasks bisa menjadi perbedaan antara good week dan bad week. Anggap figures ini reported, bukan audited.

Bar chart average cost per run pada DevRev Enterprise-Bench. TrueForge dengan Opus 4.8 rata-rata 8.50 dolar, Claude Managed Agents dengan Opus 4.8 rata-rata 11.80 dolar, dan TrueForge dengan GLM-5.2 rata-rata 2.90 dolar, dengan ketiganya menyelesaikan sekitar 11 dari 14 tasks.

Same eval, tiga configurations. Saving 30% adalah harness versus harness; saving 75% sebagian besar datang dari model swap. Figures vendor-reported, dapat direproduksi dari benchmark directory di repo.

Dalam self-run benchmark TrueFoundry pada DevRev Enterprise-Bench, TrueForge match Claude Managed Agents pada sekitar 11 dari 14 tasks: $8.50 versus $11.80 per run pada same Opus 4.8 model, sekitar 30% lebih rendah, dan $2.90 per run saat dipasangkan GLM-5.2, sekitar 75% lebih rendah, menurut announcement. Results belum independently validated, dan angka 75% mengubah harness dan model sekaligus.

Business model bukan licence

Give away runtime, sell layer di bawahnya. Open-source harness ini complete dan genuinely free, tetapi TrueForge designed untuk route setiap model call dan MCP interaction melalui AI Gateway TrueFoundry. Di gateway itulah budgets, rate limits, guardrails, access policies, dan observability hidup. Itulah commercial product, bersama hosted pay-per-usage tier bagi teams yang memilih tidak menjalankan Postgres sendiri.

Saya tidak mengatakan itu sebagai criticism; bargain yang sama ada pada banyak open-source infrastructure yang bagus, dan Meta pedigree terlihat. Pitch founders adalah control dan convenience tidak perlu berlawanan jika platform benar, dan memberikan harness gratis adalah cara menempatkan control layer Anda di bawah agents milik semua orang. Robert Rubin, Senior Director of Platform Engineering di NetApp, menggambarkan TrueFoundry sebagai "the central platform in IT where agentic apps and agents are routed through", tepat posisi yang ingin company own. Sebagai buyer, penting tahu layer mana yang Anda commit. Harness bisa di-fork. Gateway adalah subscription.

Competitive set juga semakin crowded, tanda bahwa category ini real: managed runtime Anthropic di proprietary end, LangChain Deep Agents di framework land, MIT-licensed harness DeepSeek yang masih developer preview, dan TrueForge yang membidik general-purpose production use. Ketika tiga continents ship layer software yang sama dalam satu year, layer itu load-bearing.

TrueForge free di bawah MIT, tetapi designed untuk route model dan MCP traffic melalui commercial AI Gateway TrueFoundry, tempat budget enforcement, rate limits, dan observability dijual. Early adopters yang disebut saat launch termasuk NetApp dan Automatiq, menurut launch coverage.

Apa artinya bagi open models

Ini angle yang menurut saya kurang dimainkan Western coverage. Managed runtime yang tied ke one model family adalah moat untuk family itu. Neutral runtime adalah leveller: setiap workload yang routed through TrueForge adalah workload di mana GLM-5.2, Qwen, DeepSeek, atau Kimi bisa menang berdasarkan cost per completed task, bukan brand. Angka 75% ada karena Chinese open-weight model menyelesaikan enterprise tasks dengan sekitar quarter dari Opus price. Setahun lalu, "cheap model finished about as many tasks" bukan kalimat yang mudah ditulis dengan wajah serius.

Itu pattern yang saya pantau dari Hangzhou: open-weight labs tidak harus beat frontier everywhere, mereka hanya harus close enough sehingga layer di atas berhenti peduli model mana yang ada di bawah. Neutral harness adalah exactly layer tersebut, sekarang open source dengan governance story. Jika Anda sedang menimbang apakah open Chinese models siap untuk real workloads, calculus-nya dijelaskan di risk framework yang saya gunakan dengan clients. Short version: "the harness treats it as just another endpoint" menghilangkan salah satu excuse terbaik untuk tidak testing.

Apa yang harus dilakukan sekarang

Jika Anda build atau run agents, tiga steps, dalam urutan.

  1. Hari ini: jalankan npx @truefoundry/trueforge di machine Anda dan wire one model serta one MCP server. Local mode adalah single process di SQLite, cara termurah yang saya tahu untuk membangun intuition tentang apa yang sebenarnya dilakukan harness. Tetap di localhost: tidak ada login by default, dan docs terang bahwa local mode bukan internet-facing setup.

  2. Minggu ini: ambil one agent workload yang sudah Anda jalankan, catat token spend dan completion rate, lalu reproduce shape benchmark pada own tasks. Directory benchmark/ di repo memang designed untuk itu. Number Anda adalah satu-satunya yang penting; vendor benchmarks, termasuk ini, adalah marketing sampai Anda rerun sendiri.

  3. Bulan ini: jika membayar managed-runtime prices, modelkan saving harness-only 30% terhadap actual bill, dan secara terpisah test apakah open model melewati quality bar pada same tasks. Two independent decisions, two independent spreadsheets. Jika earlier dalam journey dan masih memilih first stack, mulai dari build versus buy dan self-hosting trade-offs sebelum commit ke runtime.

FAQ

Apa itu agent harness?

Runtime layer yang mengubah language model menjadi working agent. Ia menjalankan loop di sekitar model, plan, call tools, feed results back, repeat, dan menangani semua hal yang model tidak bisa: session persistence, tool credentials, sandboxed execution, human approvals, serta menjaga context window tetap terkendali pada long tasks. TrueForge, Claude Managed Agents, dan LangChain Deep Agents semuanya harnesses; model di bawahnya interchangeable dalam tingkat berbeda.

Apakah TrueForge free?

Harness itu sendiri MIT-licensed dan free, termasuk commercial use. Yang masih Anda bayar: models, sandbox provider, Daytona saat ini, dan infrastructure Anda. TrueFoundry menjual optional governance layer, AI Gateway dengan budgets, rate limits, audit, observability, serta hosted pay-per-usage version untuk teams yang tidak ingin self-host.

Bagaimana TrueForge dibanding Claude Managed Agents?

Claude Managed Agents fully managed oleh Anthropic, billed sebagai Claude tokens plus $0.08 per running session-hour, dan Claude-only. TrueForge self-hosted, atau hosted oleh TrueFoundry, model-neutral dan free untuk dijalankan. Dalam benchmark TrueFoundry sendiri, TrueForge match task completion dengan sekitar 30% lower cost pada same model. Trade-nya: Anda mengoperasikan lebih banyak sendiri, dan benchmark berasal dari vendor, bukan independent party.

Bisakah TrueForge memakai Chinese open models seperti GLM atau Qwen?

Bisa. Ia mendukung any OpenAI-compatible endpoint, dan headline figure benchmark launch berasal dari pairing dengan GLM-5.2. Pairing itulah yang menghasilkan 75% cost reduction, yang mengatakan sebanyak itu tentang open-model pricing maupun harness.

Kesimpulan

TrueForge baru sebulan, benchmark milik sendiri, dan belum ada yang seharusnya routing payroll melewatinya. Namun shape-nya benar: harness sedang menjadi layer sendiri dalam stack, layer itu memang selalu akan mendapat neutral open-source option, dan fakta launch maths bergantung pada Chinese open model untuk menghasilkan headline number adalah quiet tell tentang arah agent economics. Perhatikan apakah independent replications dari cost claims muncul pada quarter berikutnya. Itu beda antara launch dan shift.

Jika Anda sedang mencari posisi harness dalam own agent stack, itu percakapan yang rutin saya lakukan dengan clients. Hubungi saya.

Sumber

  • TrueFoundry, "TrueForge: Open-Source Alternative to Claude Managed Agents": https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (diterbitkan 2026-08-18, diakses 2026-08-29)

  • TrueFoundry, TrueForge repository: https://github.com/truefoundry/trueforge (diakses 2026-08-29)

  • TrueFoundry Docs, "What TrueFoundry Adds on Top of TrueForge": https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (diakses 2026-08-29)

  • VentureBeat, "TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion": https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (diterbitkan 2026-08-19, diakses 2026-08-29)

  • InfoWorld, "TrueFoundry debuts open-source AI agent harness, claiming up to 75% lower costs": https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (diterbitkan 2026-08-20, diakses 2026-08-29)

  • Superpower Daily, "TrueFoundry Gives Away Its Agent Runtime to Sell the Layer Beneath It": https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (diterbitkan 2026-08-20, diakses 2026-08-29)

  • Business Wire, "TrueFoundry Launches TrueForge" (press release): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (diterbitkan 2026-08-19, diakses 2026-08-29)

Lanjutkan membaca

Agent Field Notes

Dapatkan edisi berikutnya.

Harness agen, runtime, keamanan, dan tata kelola, dijelaskan untuk orang-orang yang harus mengoperasikan sistem ini.

Menghadapi keputusan seperti ini?

Kami menjalankan tinjauan arsitektur, penilaian tata kelola, dan evaluasi framework dengan versi terkunci untuk tim yang mengambil keputusan penting tentang sistem agen.

Tentang penulis

Adam Maguire Wilson

Pendiri dan penasihat independen untuk sistem agen AI.

adam.mw