Recherche indépendante sur les systèmes d’agents
Recherche indépendante sur les systèmes d’agents responsables.
Harness the Agents est une publication et un laboratoire de recherche indépendants, guidés par les preuves. Nous étudions comment les modèles d’IA deviennent des systèmes d’agents et comment ces systèmes sont exploités de manière responsable : harnesses, environnements d’exécution, plans de contrôle, gouvernance, autorisations, mémoire, exécution, observabilité et reprise.

Recherches en vedette
Toutes les recherchesInside
DeepSeek Harness n'est pas un tueur de Claude Code. C'est quelque chose de plus intéressant.
Le harness d'agent open source de DeepSeek a dépassé les 168,000 étoiles GitHub en une semaine. Je l'ai installé, j'ai lu le dépôt et je l'ai exécuté moi-même. Voici ce qui tient la route.
Above
Amodei's Embedded Evaluators: Access Is the Whole Game
Amodei pledges embedded evaluators with employee-like access and publication rights. What the pledge promises, what it leaves open, and what is on paper today.
Inside
An Agent That Works for Weeks Needs More Than Memory
Salesforce's long-horizon runtime lets an Agentforce agent pursue a goal for weeks. Memory, durable execution and dynamic steering are documented. The authority questions are not.
Conseil
Besoin de cette rigueur sur vos propres systèmes ?
Nous évaluons, concevons et gouvernons les systèmes d'agents avec la même rigueur que celle que nous publions : évaluations épinglées par version, sélection de harnesses et architecture de plan de contrôle.
Rubriques éditoriales
Inside the Harness
Analyses de systèmes d’agents avec versions fixées : boucle, outils, mémoire, autorisations et limites d’exécution, examinés dans le code source d’une version nommée.
Above the Harness
Architecture de contrôle des systèmes d’agents en entreprise : identité, politiques, approbations, budgets, observabilité et responsabilité qu’aucun harness ne fournit à lui seul.
Harness Test
Expériences contrôlées et reproductibles : même tâche, versions fixées, prompts, environnements, traces et limites publiés.
Unharnessed
Analyse fondée sur des preuves des défaillances des systèmes d’agents : ce qui a cassé, le mécanisme sous-jacent, le rayon d’impact et les mesures d’atténuation.
Agent Field Notes
Une veille hebdomadaire : ce qui a été publié et ce que cela signifie pour les personnes qui exploitent ces systèmes.
Expériences reproductibles
Toutes les expériences sont documentées de bout en bout, afin que les résultats puissent être vérifiés et approfondis.
Méthodologie
Conception et protocole
Versions
Code et dépendances
Modèles
Fournisseurs et configurations
Métriques
Ce que nous mesurons
Traces
Journaux d’exécution
Résultats
Analyses et statistiques
Limites
Risques et réserves
Données brutes
Téléchargements
Agent Field Notes
Une veille périodique qui résume nos derniers articles et renvoie vers la recherche canonique.
Nous respectons votre boîte de réception. Désabonnement à tout moment.
