エージェントシステムに関する独立調査
責任あるエージェントシステムに関する独立調査。
Harness the Agentsは、証拠に基づく独立したパブリケーション兼研究ラボです。AIモデルがどのようにエージェントシステムへ変わるのか、そしてそれらがどう責任をもって運用されるべきかを、ハーネス、ランタイム、コントロールプレーン、ガバナンス、権限、メモリ、実行、オブザーバビリティ、復旧の各領域にわたって検証します。

注目の調査
すべての調査を見るInside
DeepSeek HarnessはClaude Codeキラーではない。もっと面白い何かだ
DeepSeekのオープンソースエージェントハーネスは、公開初週でGitHubスター168,000を超えた。私は実際にインストールし、リポジトリを読み、自分で動かしてみた。ここに検証結果を書く。
Above
Amodei's Embedded Evaluators: Access Is the Whole Game
Amodei pledges embedded evaluators with employee-like access and publication rights. What the pledge promises, what it leaves open, and what is on paper today.
Inside
An Agent That Works for Weeks Needs More Than Memory
Salesforce's long-horizon runtime lets an Agentforce agent pursue a goal for weeks. Memory, durable execution and dynamic steering are documented. The authority questions are not.
アドバイザリー
この厳密さを自社のシステムにも必要としていませんか?
公開する調査と同じ厳密さで、エージェントシステムの評価、設計、ガバナンスを支援します: バージョン固定の評価、ハーネス選定、コントロールプレーン設計。
編集セクション
Inside the Harness
バージョンを固定したエージェントシステムの分解調査。指定バージョンのソースコードで、ループ、ツール、メモリ、権限、実行境界を検証します。
Above the Harness
エージェントシステム向けの企業制御アーキテクチャ。単一のハーネスでは提供できないアイデンティティ、ポリシー、承認、予算、オブザーバビリティ、説明責任を扱います。
Harness Test
再現可能な対照実験。同じタスク、固定したバージョン、公開されたprompts、環境、トレース、制約を使用します。
Unharnessed
エージェントシステムの障害を証拠に基づいて分析します。何が壊れたか、背後の仕組み、影響範囲、緩和策を明らかにします。
Agent Field Notes
週刊インテリジェンス・ブリーフィング。何がリリースされ、それがシステム運用者にとって何を意味するのかを解説します。
再現可能な実験
すべての実験は最初から最後まで文書化されており、結果を検証し、発展させることができます。
方法論
設計とプロトコル
バージョン
コードと依存関係
モデル
プロバイダーと設定
指標
測定するもの
トレース
実行ログ
結果
分析と統計
限界
脅威と注意点
生データ
ダウンロード
Agent Field Notes
最新記事を要約し、正典となる調査へリンクする定期ブリーフィングです。
受信トレイを尊重します。いつでも配信停止できます。
