Ricerca indipendente sui sistemi di agenti
Ricerca indipendente su sistemi di agenti responsabili.
Harness the Agents è una pubblicazione e un laboratorio di ricerca indipendenti, guidati dalle prove. Studiamo come i modelli di IA diventano sistemi di agenti e come questi sistemi vengono gestiti in modo responsabile: harness, ambienti di esecuzione, piani di controllo, governance, autorizzazioni, memoria, esecuzione, osservabilità e ripristino.

Ricerca in evidenza
Vedi tutta la ricercaInside
DeepSeek Harness non è un ammazza-Claude Code. È qualcosa di più interessante.
L'agent harness open source di DeepSeek ha superato le 168,000 stelle su GitHub nella prima settimana. L'ho installato, ho letto il repository e l'ho fatto girare io stesso. Ecco che cosa regge alla prova.
Above
Amodei's Embedded Evaluators: Access Is the Whole Game
Amodei pledges embedded evaluators with employee-like access and publication rights. What the pledge promises, what it leaves open, and what is on paper today.
Inside
An Agent That Works for Weeks Needs More Than Memory
Salesforce's long-horizon runtime lets an Agentforce agent pursue a goal for weeks. Memory, durable execution and dynamic steering are documented. The authority questions are not.
Consulenza
Serve questo rigore sui vostri sistemi?
Valutiamo, progettiamo e governiamo i sistemi di agenti con lo stesso rigore che pubblichiamo: valutazioni vincolate alla versione, selezione di harness e architettura del piano di controllo.
Rubriche editoriali
Inside the Harness
Analisi di sistemi di agenti con versioni fissate: loop, strumenti, memoria, autorizzazioni e limiti di esecuzione, esaminati nel codice sorgente di una versione indicata.
Above the Harness
Architettura di controllo aziendale per sistemi di agenti: identità, policy, approvazioni, budget, osservabilità e responsabilità che nessun singolo harness può offrire.
Harness Test
Esperimenti controllati e riproducibili: stessa attività, versioni fissate, prompt, ambienti, tracce e limiti pubblicati.
Unharnessed
Analisi basata sulle prove dei guasti nei sistemi di agenti: cosa si è rotto, il meccanismo sottostante, il raggio d’impatto e la mitigazione.
Agent Field Notes
Un briefing settimanale di intelligence: cosa è stato rilasciato e cosa significa per chi gestisce questi sistemi.
Esperimenti riproducibili
Tutti gli esperimenti sono documentati dall’inizio alla fine, così i risultati possono essere verificati e ripresi.
Metodologia
Progetto e protocollo
Versioni
Codice e dipendenze
Modelli
Fornitori e configurazioni
Metriche
Cosa misuriamo
Tracce
Log di esecuzione
Risultati
Analisi e statistiche
Limiti
Minacce e avvertenze
Dati grezzi
Download
Agent Field Notes
Un briefing periodico che riassume i nostri ultimi articoli e rimanda alla ricerca canonica.
Rispettiamo la tua casella di posta. Disiscrizione in qualsiasi momento.
