本文へ移動
インサイト
Above

TrueForge: AIエージェントで難しいのはモデルではない

TrueFoundryのTrueForgeは、Claude Managed Agentsより最大75%低コストをうたうオープンソースのエージェントランタイムです。ハーネスが実際に何をするのか、ベンチマークが本当に示すもの、そしてなぜオープンモデルにとって良い知らせなのかを見ます。

執筆 Adam Maguire Wilson約18分で読めます
このページの内容

エンジニアが集まった部屋で「AIエージェントを作るうえで何が難しいか」と聞けば、多くはモデルと答えるでしょう。実際に出荷したエンジニアの部屋で同じことを聞けば、別の一覧が返ってきます。再起動しても生き残るセッション、サンドボックスへ漏れないツール認証情報、午前2時でも機能する人間承認、予算の10倍を静かに食わないコンテキストウィンドウ。モデルは午後のうちに差し替えられます。四半期を食べるのは、その周りの機械仕掛けです。

TrueFoundryが8月19日にオープンソース化したのは、その機械仕掛けです。TrueForgeはエージェントハーネス、つまりモデルの周囲でループを回すランタイム層です。計画する、ツールを呼ぶ、結果を返す、繰り返す。その途中でセッション、サンドボックス、承認、コンテキストを管理します。ローンチ時の売り文句は、AnthropicのClaude Managed Agentsに対するベンダーニュートラルな代替で、運用コストはおよそ半分というものです。その主張の根拠となるベンチマークでは、中国のオープンモデルが主役になっています。私が一番面白いと思うのはそこです。リポジトリ、発表記事、関連報道を読みました。どこまで筋が通るかを見ます。

要点 - TrueForgeはTrueFoundryによるMITライセンスのエージェントハーネスです。エージェントループを回すコアサーバー、TypeScript SDK付きHTTP API、埋め込み可能なチャットUIで構成されます。モデルプロバイダーもMCPサーバーも自由で、自社インフラ上に置けます。 - 見出し級のベンチマークでは、14タスクの企業向け評価で、TrueForgeはClaude Managed Agentsとほぼ同じタスク完了率を出し、同一モデルなら約30%安く、Opus 4.8の代わりにGLM-5.2を組み合わせると約75%安かったとしています。TrueFoundry自身のベンチマークで、独立検証はされていません。 - ランタイムは無料ですが、事業はその下のゲートウェイです。TrueFoundryは、すべてのモデル・ツール呼び出しが通るガバナンス層、予算、レート制限、監査、可観測性を販売します。 - オープンモデルにとって、こちらの方が重要な話です。中立なハーネスでは、最も安くタスクを完了できるモデルがワークロードを取ります。そして現在、その競争には中国の研究所がますます入っています。 - ローカルモードはSQLiteを使う単一プロセスで、ログイン機能もありません。感触を確かめるためのものとして扱い、それ以上に見ないでください。

何が起きたのか

8月19日、元Metaエンジニアが2021年に設立したサンフランシスコのAIインフラ企業TrueFoundryは、TrueForgeをMITライセンスで公開しました。同じ週にVentureBeatとInfoWorldが取り上げ、リポジトリは数日で1,800スターを超えました。主な点は次の通りです。

  • ハーネスはエージェント実行ループ全体を動かします。モデル呼び出し、MCPツール、スキル、サンドボックス化されたコード実行、人間承認、コンテキスト管理、セッション状態を端から端までストリーミングします。

  • 3つの形で公開されています。同梱チャットUI、TypeScript SDK(@truefoundry/trueforge-sdk)付きHTTP API、そして自社製品内にインターフェースを置くための埋め込みUI SDK(@truefoundry/trueforge-ui)です。

  • モデルはYAMLカタログから選びます。OpenAI、Anthropic、Geminiのほか20社ほど、さらに任意のOpenAI互換エンドポイントに対応します。スキルはgit管理のSKILL.mdパックで、Claude Codeが広めたのと同じ慣例です。

  • 実行形態は2つです。ローカルモードは1プロセスとSQLiteで、npx @truefoundry/trueforgeから起動します。チーム向けホステッドモードはPostgresとRedisを使い、Docker ComposeまたはHelmで動きます。

  • 自前運用したくないチーム向けに、TrueFoundryが従量課金のホステッド版も提供します。NetAppとAutomatiqが初期利用者として挙げられ、TrueFoundry自身の社内アシスタントでも使われています。

TrueForgeはTrueFoundryが2026年8月19日に公開したオープンソース、MITライセンスのエージェントハーネスです。モデル呼び出し、MCPツール、サンドボックス実行、承認、コンテキスト管理、セッション状態を含むエージェントループを動かし、チャットUI、TypeScript SDK付きHTTP API、埋め込みUIから利用できます。TrueFoundryの発表に基づきます。

争う価値がある層が、なぜハーネスなのか

エージェントのデモを作るのは簡単です。50体を本番で回すのは違います。その2つの間にあるものは、全部ハーネスの仕事です。モデルは推論できます。しかし行動はできません。ファイルを開き、APIを呼び、3ターン前に言ったことを覚え、間違ったテーブルを削除する前に止まるのは、モデル単体ではありません。誰かのコードが、それらを繰り返し、安全に、予測可能なコストで行う必要があります。

少し前まで選択肢は2つでした。自分でハーネスを作るか。数か月の配管作業になり、製品の代わりにランタイムを保守することになります。あるいはモデルプロバイダーから借りるか。Claude Managed Agentsが後者です。Anthropicがループを運用し、Claudeトークン料金に加え、稼働セッション1時間あたり0.08ドルをミリ秒単位で課金します。便利ですが、構造的には扱いづらい。ランタイム、ツール、課金が1社のものになった瞬間、ロードマップもその会社のものになります。

だからこそ、モデル一覧よりコンテキストエンジニアリング機能の方が重要です。TrueForgeにはサブエージェント、遅延ツール読み込み、必要になるまでツール定義を毎プロンプトへ詰め込まない仕組み、大きな結果の外部退避、コンテキスト圧縮があります。長いエージェント実行が自分自身の履歴で溺れないための一式です。贅沢品ではありません。TrueFoundryのベンチマークでは、同じタスク、同じモデルで、同社構成が1実行あたり380万トークンだったのに対し、Claude Managed Agentsは1,000万トークンを消費しました。この数字を割り引いて読んでも、方向性は正しい。エージェント費用の多くはコンテキストの無駄であり、コンテキスト処理はハーネスの仕事です。私がクライアントに、エージェント型アーキテクチャで面白い問いは「どのモデルか」より「何がそれを包むか」だと話すのも同じ理由です。

エージェントハーネスは、モデルが扱えない本番上の問題、セッション、ツール認証情報、サンドボックス、承認、コンテキスト増大を管理します。TrueFoundryのベンチマークでは、同一タスクでTrueForgeは1実行380万トークン、Claude Managed Agentsは1,000万トークンを使ったとしており、同社は差をコンテキスト圧縮と遅延ツール読み込みによるものと説明しています。

ベンチマークを慎重に読む

どの記事でも75%という数字が見出しになっています。分解してみましょう。実際には、トレンチコートを着て1つに見せかけた2つの数字です。

TrueFoundryはDevRevのEnterprise-Bench、模擬CRM、課題管理、文書システムをまたぐ14タスク評価でテストしました。同じタスク、同じツール、同じモデルなら、結果はこうです。

  • AnthropicのOpus 4.8でTrueForgeを動かすと、14タスク中約11件を完了し、1実行平均8.50ドルでした。

  • 同じOpus 4.8でClaude Managed Agentsを動かすと、完了数はほぼ同じで、1実行11.80ドルでした。

  • ZhipuのオープンウェイトモデルGLM-5.2でTrueForgeを動かしても、完了数はほぼ同じで、1実行2.90ドルでした。

したがって、正直に分けるとこうです。同じモデルでハーネス同士を比較した節約は約30%で、主にマネージドサービスの上乗せと前述のトークン削減です。75%へ跳ねるのは、モデルまでOpus 4.8からGLM-5.2へ変えたときです。ある鋭い解説が指摘した通り、この比較は2変数を同時に変えています。そしてTrueForgeそのもの以上に、オープンモデルがどこまで来たかを示しています。ある意味では、それこそTrueFoundryの本当の主張です。ハーネスが中立なら、その節約を自由に取りに行けます。

注意点をさらに2つ。ベンチマークはTrueFoundry自身が実行し、より大きな本番ワークロードで独立検証されていません。そして14タスクは少ないサンプルです。3タスク分のばらつきで、良い週と悪い週が入れ替わります。監査済みの数字ではなく、報告値として扱ってください。

DevRev Enterprise-Bench評価の1実行あたり平均コストを示す棒グラフ。TrueForge+Opus 4.8は8.50ドル、Claude Managed Agents+Opus 4.8は11.80ドル、TrueForge+GLM-5.2は2.90ドルで、3構成とも14タスク中およそ11件を完了した。

同じ評価を3構成で比較しています。30%の節約はハーネス対ハーネス、75%の節約の大半はモデル変更から来ます。ベンダー報告値であり、リポジトリのベンチマークディレクトリから再現可能です。

TrueFoundry自身がDevRev Enterprise-Benchで実施したベンチマークでは、TrueForgeとClaude Managed Agentsはいずれも14タスク中およそ11件を完了しました。同じOpus 4.8ならTrueForgeが1実行8.50ドル、Claude Managed Agentsが11.80ドルで約30%安く、GLM-5.2を組み合わせると2.90ドルで約75%安かったとしています。発表に基づきます。結果は独立検証されておらず、75%という数字ではハーネスとモデルの両方が変わっています。

ビジネスモデルはライセンスではない

ランタイムを無料で配り、その下の層を売る。オープンソースのハーネスは完全で、本当に無料です。ただしTrueForgeは、すべてのモデル呼び出しとMCP通信をTrueFoundryのAI Gatewayへ通すよう設計されています。予算、レート制限、ガードレール、アクセスポリシー、可観測性があるのはゲートウェイ側です。そこが商用製品です。Postgresを自分で運用したくないチーム向けの従量課金ホステッド版も同様です。

批判として言っているわけではありません。良質なオープンソース基盤ではよくある取引で、Meta出身という背景も感じます。創業者たちの売り文句は、正しいプラットフォームなら制御と利便性は対立しない、というものです。ハーネスを無料で配るのは、自社の制御層を皆のエージェントの下へ入れる方法です。NetAppのプラットフォームエンジニアリング担当シニアディレクター、Robert RubinはTrueFoundryを「エージェント型アプリとエージェントが経由するITの中央プラットフォーム」と表現しています。まさに同社が所有したい位置です。買い手としては、どの層にコミットするのか知っておく価値があります。ハーネスはフォークできます。ゲートウェイはサブスクリプションです。

競合が急速に増えています。それ自体、このカテゴリーが本物だという証拠です。プロプライエタリ側にはAnthropicのマネージドランタイム、フレームワーク側にはLangChainのDeep Agents、まだ開発者プレビューながらDeepSeek自身のMITライセンスハーネス、そして汎用本番利用を狙うTrueForge。3大陸から1年以内に同じソフトウェア層が出てくるなら、その層は荷重を支えています。

TrueForge自体はMITで無料ですが、モデルとMCPの通信をTrueFoundryの商用AI Gatewayへ通すよう設計され、そこで予算強制、レート制限、可観測性が販売されます。ローンチ時に挙げられた初期導入企業にはNetAppとAutomatiqがあります。ローンチ報道に基づきます。

オープンモデルに何を意味するか

西側の報道が一番過小評価したのは、ここだと思います。1つのモデルファミリーに結び付いたマネージドランタイムは、そのファミリーの堀になります。中立なランタイムは競争条件を平らにします。TrueForgeを通るすべてのワークロードは、GLM-5.2、Qwen、DeepSeek、Kimiがブランドではなく「完了タスク当たりコスト」で勝てるワークロードです。75%という数字が存在するのは、中国のオープンウェイトモデルがOpusの4分の1程度の価格で企業タスクを完了できたからです。1年前なら「安いモデルでも、ほぼ同じ数のタスクを完了した」と真顔で書くのは難しかったでしょう。

これは、私が杭州からしばらく見てきたパターンでもあります。オープンウェイトの研究所は、あらゆる場所で最先端モデルに勝つ必要はありません。その上の層が「下でどのモデルが動いているか」を気にしなくなる程度まで近づけばいい。中立なハーネスはまさにその層であり、今ではガバナンスの物語まで付いたオープンソースです。中国のオープンモデルが実ワークロードに使える段階かを検討しているなら、その計算は私がクライアントと使うリスクフレームワークで詳しく扱っています。短く言えば、「ハーネスから見れば別のエンドポイントにすぎない」なら、試さない理由の1つが消えます。

今やるべきこと

エージェントを作る、または運用しているなら、次の3つをこの順番で進めてください。

  1. 今日: 自分のマシンでnpx @truefoundry/trueforgeを実行し、モデル1つ、MCPサーバー1つを接続してください。ローカルモードはSQLiteを使う単一プロセスで、ハーネスが実際に何をするのか直感を得るには、私が知る限り最も安い方法です。ローカルホストのまま使ってください。デフォルトではログイン機能がなく、ドキュメントもローカルモードはインターネット公開用ではないと明記しています。

  2. 今週: すでに動かしているエージェントワークロードを1つ選び、トークン消費量と完了率を記録したうえで、自分のタスク上でベンチマークと同じ比較を再現してください。リポジトリのbenchmark/ディレクトリはそのために作られています。重要なのは自分の数字だけです。このベンチマークを含め、ベンダーのベンチマークは自分で再実行するまでマーケティングです。

  3. 今月: マネージドランタイム料金を払っているなら、ハーネスだけで30%節約できるという主張を自社請求額に当てはめて計算し、別途、同じタスクでオープンモデルが品質基準を超えるか試してください。独立した2つの判断を、独立した2枚の表で扱うべきです。まだもっと早い段階で最初のスタックを選んでいるなら、ランタイムを決める前に内製対購入とセルフホストのトレードオフから始めてください。

FAQ

エージェントハーネスとは何ですか?

言語モデルを動くエージェントへ変えるランタイム層です。モデルの周囲でループ、計画、ツール呼び出し、結果の返却、反復を回し、モデル自身にはできないこと、セッション永続化、ツール認証情報、サンドボックス実行、人間承認、長いタスクでのコンテキストウィンドウ管理を処理します。TrueForge、Claude Managed Agents、LangChainのDeep Agentsはいずれもハーネスで、その下のモデルは程度の差こそあれ交換可能です。

TrueForgeは無料ですか?

ハーネス自体はMITライセンスで、商用利用も含め無料です。それでも費用がかかるものは、モデル、サンドボックスプロバイダー、現時点ではDaytona、自社インフラです。TrueFoundryは任意のガバナンス層、予算、レート制限、監査、可観測性を備えたAI Gatewayと、自前ホストしたくないチーム向けの従量課金版を販売します。

TrueForgeとClaude Managed Agentsはどう違いますか?

Claude Managed AgentsはAnthropicが完全管理し、Claudeトークンに加えて稼働セッション1時間あたり0.08ドルで課金され、Claude専用です。TrueForgeはセルフホスト、またはTrueFoundryのホステッド版で、モデル中立、ランタイム自体は無料です。TrueFoundry自身のベンチマークでは、同じモデルでタスク完了率をほぼ維持しつつ約30%低コストでした。代わりに自分で運用する部分が増え、ベンチマークも独立調査ではなくベンダー自身のものです。

TrueForgeはGLMやQwenのような中国のオープンモデルを使えますか?

はい。任意のOpenAI互換エンドポイントをサポートします。ローンチ時ベンチマークの見出し級の数字も、GLM-5.2との組み合わせから出ました。75%のコスト削減はこの組み合わせで実現しており、ハーネスだけでなくオープンモデルの価格設定についても多くを語っています。

結論

TrueForgeはまだ1か月のプロジェクトで、ベンチマークも自社実施です。給与処理を今すぐ流すべきものではありません。それでも形は正しい。ハーネスはスタックの独立した層になりつつあり、その層にはいずれ中立なオープンソース選択肢が出る運命でした。そしてローンチ時の計算が、見出し級の数字を作るために中国のオープンモデルへ依存している事実は、エージェント経済がどこへ向かっているかを静かに示しています。次の四半期にコスト主張の独立再現が出るかを見てください。それが、単なるローンチと構造的な変化の違いです。

自社のエージェントスタックでハーネスをどこに置くべきか考えているなら、これは私がクライアントと定期的に話しているテーマです。お問い合わせください。

情報源

  • TrueFoundry、「TrueForge: Claude Managed Agentsに代わるオープンソース選択肢」: https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (2026年8月18日公開、2026年8月29日取得)

  • TrueFoundry、TrueForgeリポジトリ: https://github.com/truefoundry/trueforge (2026年8月29日取得)

  • TrueFoundry Docs、「TrueForgeに対してTrueFoundryが追加するもの」: https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (2026年8月29日取得)

  • VentureBeat、「TrueFoundryのオープンソースAIエージェントハーネスTrueForge、タスク完了コストがClaude Managed Agentsより30%から75%安いと主張」: https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (2026年8月19日公開、2026年8月29日取得)

  • InfoWorld、「TrueFoundryがオープンソースAIエージェントハーネスを公開、最大75%低コストと主張」: https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (2026年8月20日公開、2026年8月29日取得)

  • Superpower Daily、「TrueFoundryはエージェントランタイムを無料で配り、その下の層を売る」: https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (2026年8月20日公開、2026年8月29日取得)

  • Business Wire、「TrueFoundryがTrueForgeを公開」(プレスリリース): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (2026年8月19日公開、2026年8月29日取得)

続きを読む

Agent Field Notes

次号を受け取る

エージェント・ハーネス、ランタイム、セキュリティ、ガバナンスを、実際に運用する人のために解説します。

同じような決断に直面していますか?

エージェントシステムに関する重要な決定を行うチームのために、アーキテクチャレビュー、ガバナンス評価、バージョンを固定したフレームワーク評価を実施しています。

著者について

Adam Maguire Wilson

創設者、AIエージェントシステムの独立アドバイザー

adam.mw