本文へ移動
アーカイブ
執筆 Harness the Agents

DeepSeek HarnessはClaude Codeキラーではない。もっと面白い何かだ

DeepSeekのオープンソースエージェントハーネスは、公開初週でGitHubスター168,000を超えた。私は実際にインストールし、リポジトリを読み、自分で動かしてみた。ここに検証結果を書く。

The DeepSeek Harness wordmark beside the DeepSeek whale logo, in blue on a white background with faint circuit-board traces.

DeepSeek HarnessはClaude Codeキラーではない。もっと面白い何かだ

READMEはワンラインインストールを約束している。npx @deepseek-ai/dsh webと打てば、もう使える。私のマシンでは、その一行に16分かかり、npxキャッシュに数百のパッケージが流し込まれ、次に実行したときも再解決にさらに10分かかった。これをDeepSeekのせいにするつもりはない。あえて触れるのは、ワンラインの約束と16分の現実の間にある落差こそが、DeepSeek Harnessという物語の縮図そのものだからだ。8月13日に出てきたものは、本当に面白く、本当に荒削りで、そして広く読み違えられている。

読み違いはこういう形をしている。DeepSeekはClaude Codeの競合を作った、というものだ。ローンチ時の報道の大半がこの枠組みに飛びついた。理由は分かる。見た目はそうだし、動きもそうだし、一部は文字通りClaude Code自身に書かせたコードだ。だがそれは間違った枠組みだ。リポジトリを読み、実際に動かし、他の人々がこれについて立てた主張を検証するのに1週間を費やした今、本当の物語はもう一つ上のレイヤーにあると私は思う。

要点

DeepSeek Harness(dsh)はMITライセンスのエージェントコーディングハーネスで、2026年8月13日に開発者プレビューとして公開された。初週でGitHubスター168,000、npmダウンロード552,000を超えた。「すべてがプラグイン」という主張は文字通り本当だ。モデルアダプタ、ツール、そしてエージェントループ自体もすべて交換可能で、AI以外の領域で4年の本番稼働歴を持つフレームワークの上に作られている。トークン喰いは事実であり、裏付けもある。ただし99%近いキャッシュヒット率が請求額を和らげる。これは日常使いの道具ではなく、いじくり回す人のためのプレビューと考えるべきだ。ツールそのものより戦略的な動きのほうが重要だ。モデルラボがハーネスレイヤーを無償で配っている。これはClaude Codeの機能リストへの攻撃ではなく、ハーネスをサブスクリプションとして売るビジネスモデルへの攻撃だ。

始める前に、方法について一つ断っておく。以下のリポジトリ、インストール、実行に関する記述はすべて、今週私自身が確かめた一次情報だ。他人のテストに依拠する箇所では、その旨を明記し、名前も挙げる。

DeepSeekは実際に何を出したのか

2026年8月20日時点で、リポジトリは公開から1週間で168,325スターに達し、npmパッケージは8月12日から18日の週に552,210回ダウンロードされた。互換性を予告なく壊すと自らのドキュメントで警告している開発者プレビューとしては、かなりの数字だ。その数字が買っているのは、ローカルのエージェントハーネスだ。dsh webを実行するとブラウザのインターフェースがポート3080で開き、ワークスペースを指定し、モデルとモードを選び、あとは働かせる。

私が最も示唆的だと思うのは、中身だ。これはAPIの薄いラッパーではない。私がソースからビルドしたチェックアウトには226のワークスペースパッケージがあり、read-onlyからdanger-full-accessまでのサンドボックスモードを持つ権限システムと、4つのエージェントプリセットがある。Standardはフルのコーディングエージェント、PTCはモデルに1つのプログラムを書かせてそれを実行する、Minimalはツール2個のみで、自己拡張するCreatorモードには「シェルアクセスとして扱え」というヘッダコメントが付いている。

何より注目すべきなのは、公式のプラグインパッケージが、このハーネスにClaude CodeとCodexをサブエージェントとして呼び出させられることだ。DeepSeekのハーネスは、ライバルのはずの相手に喜んでサブタスクを委任する。さらに、すべてのセッションは追記専用のログに書き込まれ、完全なシステムプロンプト、すべてのツール呼び出し、すべてのトークン数が記録される。私自身のテスト実行では、10ステップのタスクで250のイベントが生成され、事後にそのすべてを検査できた。

一つ実用上の注意がある。同名の無関係なサードパーティプロジェクトも存在する。5月に公開されたプロトコルアダプタで、同じくdeepseek-harnessという名前だ。探すなら、deepseek-aiオーガニゼーションのほうを目指してほしい。もう一方は悪意があるわけではないが、紛らわしい名前だ。

DeepSeek HarnessはMITライセンスのエージェントコーディングハーネスで、2026年8月13日に開発者プレビューとして公開された。GitHubリポジトリは1週間で168,000スターを超え、このツールはClaude CodeやCodexと競合するだけでなく、それらをサブエージェントとしてオーケストレーションできる。

フレームワークはチャットボットのエコシステムから来た

英語圏の報道がほとんど見逃した部分がここだ。DeepSeekはこのハーネスのプラグインアーキテクチャをゼロから作ったわけではない。基盤となっているのはCordisだ。MITライセンスのTypeScriptプラグインフレームワークで、数千のコミュニティプラグインを持つチャットボットフレームワークKoishiの下で、2022年から本番稼働している。Cordisの作者であるYifan Shiは、リリースと同時にDeepSeekが公開した論文の筆頭著者で、署名欄には北京大学の所属が記されている。その論文はセルフホストのプレプリントで88ページあり、草稿であることが正直に明記されている。Cordisリポジトリ自体は、私が8月20日に確認した時点で6,465スターだった。

この論文が形式化した概念には、時空間的合成可能性(spatiotemporal composability)という仰々しい名前と、平易な意味がある。時間的側面:システムのどの部分も実行時にアンロードでき、それが行ったすべてのことはきれいに取り消される。空間的側面:各部品は自分が何に依存するかを宣言し、依存先の出現や消滅に合わせて起動したり停止したりする。論文は、ものを読み込み、取り外す順序は結果に影響しないこと、つまり順序にかかわらずシステムは同じ状態に収束することを証明している。これが解決済みの問題に聞こえるなら、違う。論文の動機付けとなる統計は、最も人気のあるVSCode拡張100個のうち87個が、エディタを再起動せずにはアンロードできないというものだ。

「すべてがプラグイン」がマーケティングなのか仕組みなのかを確かめたくて、私は解決済みの設定をダンプしてみた。仕組みだった。デフォルトのwebプロファイルは、24のYAMLパッチレイヤーにまたがる135のプラグイン行で構成され、各行にはどのパッケージが寄与したかの注釈が付いている。モデルアダプタ、ツールレジストリ、セッションログ、エージェントループ。すべてプラグインであり、すべて可逆だ。リポジトリはさらに、すべてのソースファイルにCIで100%のテストカバレッジを要求している。公開1週間のプレビューとしては、笑ってしまうほど厳しい水準だ。

DeepSeek HarnessはCordisの上で動く。CordisはKoishiチャットボットエコシステムで2022年から本番稼働しているプラグインフレームワークで、北京大学とDeepSeekによる88ページのプレプリントで形式化された。その中核となる保証は、どのコンポーネントも実行時に読み込み・取り外しが可能で、順序にかかわらずシステムは同じ状態に収束するというものだ。

ライバルのツールで作られた

ここからが、気まずくて面白い部分だ。コードフォレンジックのレポート(winzheng.com、単一の情報源だが、スクリプトは再現可能だと自称している)がコミット履歴を調べたところ、最初の12,293コミットのうち1,760にcodex/ブランチプレフィックスが付いており、11番目のコミットのタイトルは「fix issues found in the second round of Codex review」で、AGENTS.mdを指すCLAUDE.mdシンボリックリンクが最初のコミットから存在したという。平たく言えば、DeepSeekのチームはこのハーネスを、OpenAIのCodexとAnthropicのClaude Codeをループに組み込んで、かなりの比重で構築したのだ。

私はこれを、スキャンダルではなく愉快な話として分類する。私の知るまともなエンジニアリングチームは今やみんなこうしたツールを使って開発しており、DeepSeekも明らかにそうだ。同じレポートは、より刺激的な噂、つまりこのハーネスは流出したClaude Codeのソースから盗まれたという説も検証し、文字列の一致はまったく見つからなかった。この噂はかなり出回ったので、言っておく価値がある。フォレンジックが実際に示しているのは、噂より面白いことだ。モデルはコモディティであり、その周りのループこそがプロダクトだというこのラボの確信は、自社ソフトウェアの作り方にまで及んでいる。

正直さのためにもう一つ。このハーネスは、英語の報道が触れていない部分で中国語ファーストだ。プリセットのメタデータファイルは中国語で先に書かれており、出荷されるUI文字列の一部は中国語のみだ。DeepSeekが早期採用者として誰を想定しているかの、小さく具体的な兆候が欲しければ、これだ。

自分で動かしてみた

ハーネスについて読むだけでは限界があるので、実際のタスクを実行した。DeepSeekのAPIキーではなく、OpenCode Goのサブスクリプションキーを使った。こちらは7つ以上のラボの16モデルのカタログ経由でルーティングされる。この選択は偶然だったが、結果的にテスト全体で最も示唆に富む部分になった。DeepSeek自身のAPIに一切近づかずに、DeepSeekのハーネスをDeepSeekのV4 Flashモデルで動かしたのだ。アーキテクチャが約束するプロバイダ交換は理論上の話ではない。YAMLファイル1つと環境変数1つで済む。

タスクはこうだ。杭州、ロンドン、ニューヨークの現在時刻を表示するシングルページサイトを作り、それを検証せよ。実行には2分8秒、10ステップ、9回のツール呼び出しがかかり、入力の91%がキャッシュから供給された状態で約108,000トークンを消費した。エージェントは環境を調べ、ページを書き、自分のJavaScriptを取り出してnodeで構文チェックし、自分の検証スクリプトの丸め誤差バグを発見し、それを修正し、チェックを再実行した。私はその後、出力を独立して検証した。タイムゾーンの計算は正しかった。ロンドンが現在英国夏時間で、ニューヨークがEDTであることも含めて。小さなタスク、正しい結果、完全なログ。

荒削りな部分も本物だ。ソースチェックアウトからの起動は、ドキュメントに書かれていない形で作業ディレクトリに敏感だ。ヘッドレスモードはトークンのサマリーを出力しない。私はセッションログから手計算で数字を出した。そしてシステムプロンプトは、私が設定したルートの名前がそうだったために、モデルに対して自分はdeepseek-v4-flashだと伝えていた。これ自体は問題ないが、誰かが別のモデルをプロキシして、エージェントが間違った自己認識を育てるまでは。どれもプレビュー級の話だ。

2026年8月20日の一次テストで、DeepSeek Harnessは検証済みのシングルページ構築を2分8秒、10ステップで完了した。DeepSeek自身のAPIではなくサードパーティのOpenCode Goモデルキー経由で動かし、約108,000トークン、91%のキャッシュ読み取り率だった。

正直な請求額

このハーネスへの最も強い批判はトークンを浪費するというもので、その批判は支持に耐える。Julian GoldieのAI Success Labはローンチ週に、同じ1ページサイトでClaude Codeと時間を計測して比較した。DeepSeekのスタックは約483,000トークンを使い、Claude Codeは48,000トークンだった。ただしDeepSeek側は11分で完了し、Claude Codeの30分以上に対して、費用は約5セントだった。あるRedditユーザーの並行比較でもコードレビュータスクで同じ傾向が見られ、本人の追記では、dshの設定をまったく調整していなかったと認めている。

テスト

トークン

時間

備考

1ページサイト、dsh + V4 Pro(AI Success Lab)

~483,000

11分

~$0.05、キャッシュ多用

1ページサイト、Claude Code(同一タスク)

~48,000

30分以上

品質スコアは高め、9/10 vs 7/10

コードレビュー、dsh未調整(Reddit)

500,000

n/a

キャッシュヒット率70%

コードレビュー、OpenCode(同一タスク)

~70,000

n/a

キャッシュヒット率95%

時計ビルド、私の実行(8月20日)

~108,000

2分8秒

キャッシュ読み取り91%、出力検証済み

経済性を救うのはキャッシュだ。QbitAIのテスター、つまり2週間のクローズドベータアクセスを持つ中国のメディアは、約99%のキャッシュヒット率を計測しており、私自身の実行も91%だった。キャッシュされた入力はほぼ無料なので、恐ろしく見えるトークン数は小さな請求額に変換される。

信頼性のほうが柔らかい下腹だ。AtlasCloudがISSトラッカーのビルドをローンチ報道から3回再実行したところ(開示情報:ベンダーブログであり、自社のホストエンドポイントに対して実行)、3回のうち2回で、ブラウザ上のページが実際には壊れているのに、ハーネスは「Done」と出力した。私の時計タスクはきれいに検証できたが、私の時計タスクはまた自明なものでもあった。デモはデモとして扱うべきだ。

DeepSeek Harnessはトークン喰いだがキャッシュ多用でもある。2026年8月の独立系テストでは、同一タスクでClaude Codeの約10倍のトークン消費が示されているが、99%近いキャッシュヒット率と、キャッシュ済み入力トークン100万あたり$0.007から$0.014というDeepSeekの公式価格によって相殺される。

DeepSeek Harnessの費用はいくらか

価格には日付の刻印が必要だ。ローンチ週の報道の多くは、すでに間違っているからだ。8月16日、DeepSeekはAPIをピーク・オフピーク価格に移行した。8月20日時点で、公式価格ページは、V4 Flashを時間帯によって入力トークン100万あたり$0.22から$0.44、出力は$0.66から$1.32、キャッシュヒットは$0.007から$0.014と記載している。Proはその3倍だ。もしレビューが一律$0.14という価格を引用していたら、それは6月の数字を引用している。これらの数字がなぜ低いままでいられるのか、その長い説明は中国のAI価格戦争の仕組みにある。

2つのモデルの間では、初期のコンセンサスは私の直感と一致する。日常の作業にはFlash、問題が本当に難しいときはProだ。この2つを他のラインナップと比べて検討しているなら、Qwen vs DeepSeek vs Llamaで継続的な比較を追っている。

DeepSeek Harnessは安全に実行できるか

いつものように、まず展開の前提を述べる。ハーネスはローカルで動き、モデルのルートは自分で選ぶ。したがってデータレジデンシーの問題は、ハーネス自体ではなく、どのプロバイダに向けるかの問題だ。私のテストでは、プロンプトはDeepSeekではなくOpenCode Goのサーバーに送られた。現実の注意点は2つ残る。リポジトリ自身の注記によれば、テレメトリはデフォルトで無効だが、有効にした場合、マスキングのルールなしで送信される。そしてプラグインはあなたの権限でインプロセスで実行される。つまりプラグインエコシステムはサプライチェーンの問題であり、それはDeepSeekがエンタープライズで安全かという問題と同じ形をしている。独立したセキュリティ監査は、まだ誰も行っていない。

この動きが意味するもの

このリリースについてのDeepSeek自身のプロダクトページは、論旨を4語で述べている。Agent equals Model plus Harness。モデルはトークンを予測し、ハーネスはどのツールを与えるか、いつ止めるか、何を記憶するかを決める。VentureBeatのローンチ報道は鋭い枠組みを示した。フロンティアモデルが能力で収束すれば、エージェントがワークフローをまたいでどう推論し、どう持続するかを制御するレイヤーは、モデル自体よりはるかに置き換えが難しくなる。ここで問いが生じる。なぜラボはそのレイヤーをMITライセンスで配るのか。

高価なものを無償で配るのがDeepSeekのやり方だからだ。モデルレイヤーではオープンウェイトでそれをやった。その物語の長い版は、中国のオープンウェイトエコシステムのフィールドガイドにある。ハーネスは、同じ楔を1つ上のレイヤーに打ち込んだものだ。あるソースコードレビュアーが引用した36Krの論評は、言われない部分を率直に言っていた。これはClaude Codeの機能リストへの攻撃ではなく、有料プロダクトとしてのハーネスへの攻撃だ。この賭けが実を結ぶかどうかは、DeepSeekが制御できない何かにかかっている。見知らぬ人々が実際にプラグインを作るかどうかだ。私が注目するのはスター数ではなく、その数字だ。

では試すべきか。いじるのが好きなら、イエスだ。インストールは重いが、ソースビルドはきれいで、これほど規律のあるコードベースを読むのは本当に楽しい。モデルを自前でホストしている、あるいはスケールでのコストが気になるなら、プロバイダ設定こそがこの演習の要点として、イエスだ。安定した日常使いの道具が必要なら、ノーだ。リポジトリは破壊的変更を文書で約束しており、それを本気で言っている。

DeepSeek Harnessは単なるツールではなく戦略的なリリースだ。ハーネスレイヤーをMITライセンスで公開し、「Agent = Model + Harness」を宣言することで、DeepSeekはハーネスはコモディティであるべきだと主張している。以前オープンウェイトでモデルレイヤーに打ち込んだのと同じ楔だ。

よくある質問

DeepSeek Harnessはシェルアクセス付きで安全に実行できるか

ハーネスはローカルで動くので、質問は2つに分かれる。プロンプトは設定したモデルプロバイダのどこかに送られ、組み込みのサンドボックスはread-onlyから始まり、その上にworkspace-writeとfull-accessモードがある。より鋭いリスクはプラグインだ。それらはあなたの権限でインプロセスで実行され、公開1週間のプラグインエコシステムにはまだ独立した監査がない。

DeepSeek Harnessは本当にClaude CodeとCodexを呼び出せるのか

はい。これは報道での主張だけでなく、リポジトリで確認できる。subagent-claude-codesubagent-codexという名前のオプションプラグインパッケージが、公式のClaude Agent SDKとCodexのapp-serverを駆動する。それらのツールは引き続きインストールと認証が必要だ。ハーネスが提供するのはオーケストレーションであり、サブスクリプションではない。

DeepSeek HarnessではFlashとProのどちらを使うべきか

ほとんどの作業にはFlashだ。初期の独立系テストでは、どちらの道でも同一タスクでClaude Codeの約10倍のトークン使用量が示されている。したがって経済性が成り立つのは安いモデルのほうだ。2026年8月20日時点で、DeepSeekの公式価格はFlashの出力をProの3分の1の価格としている。Proは、追加の推論が本当に必要な問題に取っておくべきだ。

結論

DeepSeek Harnessは、荒削りで、規律正しく、真に新しいエンジニアリングの成果であり、ローンチ報道の大半はそれを間違ったものとして描写した。これはClaude CodeをClaudeで超えようとしているのではない。モデルラボが、モデルの上のレイヤーは自由であるべきだと宣言し、その宣言を4年物のチャットボットフレームワークの部品とライバル自身のコーディングツールで組み立てたのだ。その宣言が定着するかどうかはプラグイン作者たちにかかっており、判断には数カ月かかるだろう。それまでは、今年私がやった中で最も示唆に富む16分のインストールだ。

中国のモデルやエージェントツールを実際の仕事で検討しているなら、ご連絡ください

出典(すべて2026-08-20に取得):