IA

Claude guida un quarto della ricerca Anthropic: così l’IA costruisce la prossima versione di se stessa

Adrian Kessler
Aggiungici su Google

Un compito di ricerca AI su quattro in Anthropic è ora guidato da Claude. Non assegnato a Claude come assistente, non revisionato da Claude in seguito — ma avviato da un prompt di alto livello e completato dall’inizio alla fine, con un umano che verifica il risultato a lavoro concluso. Nove mesi fa, quella percentuale era inferiore all’uno per cento.

Anthropic traccia una linea tra due cose. Quando Claude guida un compito, gestisce la maggior parte del lavoro in modo indipendente; un supervisore esamina l’output piuttosto che guidare ogni passaggio. Questa è una categoria diversa dal novanta percento della R&S totale di Anthropic in cui Claude agisce come collaboratore — un umano guida, Claude gestisce parti specifiche. “Guida” è la classificazione più difficile. Ora rappresenta il 26 percento di tutta la ricerca AI che l’azienda svolge, ponderato per il tempo che i ricercatori avrebbero altrimenti speso su quei compiti.

La scala è concreta. Circa 30.000 agenti Claude operano simultaneamente sulle piattaforme interne di Anthropic, svolgendo lavoro su addestramento di modelli, valutazioni, ricerca sull’interpretabilità e analisi della sicurezza. Ad agosto, questi agenti hanno preso complessivamente più di un miliardo di decisioni. I sistemi di monitoraggio in tempo reale di Anthropic hanno bloccato lo 0,002 percento di esse — circa una ogni 47.000 azioni — prima dell’esecuzione. Un livello offline ha poi segnalato circa 100.000 trascrizioni a settimana per la revisione, portando all’attenzione umana circa 50 di esse.

La sicurezza ha un budget misurabile all’interno di quel sistema. Durante una singola settimana di luglio, il lavoro dedicato a mantenere al sicuro gli agenti ha consumato il sei percento di tutta la potenza di calcolo di ricerca e sviluppo AI, e il dodici percento della potenza di calcolo che la stessa R&S guidata dall’AI stava utilizzando. Anthropic afferma di aver classificato in modo conservativo, escludendo i classificatori di sicurezza dedicati dal conteggio, il che suggerisce che la proporzione reale sia ancora più alta.

Un problema epistemologico è al centro di tutto questo. Il contributo di Claude alla ricerca di Anthropic è valutato in parte dallo stesso Claude. Un modello Claude valuta il lavoro di Claude; le cifre di supervisione coprono solo una piattaforma interna; e la classificazione della potenza di calcolo si è basata su modelli Claude che campionavano ed etichettavano le proprie esecuzioni. Nessuna terza parte indipendente ha verificato la metodologia. I tre numeri pubblicati da Anthropic sono precisi, ma sono precisione auto-riportata — che è una cosa diversa dalla precisione verificata.

Anthropic afferma che inizierà a integrare valutatori esterni nel processo. Nessun nome, nessuna data di inizio, e nessuna divulgazione comparabile da altri laboratori di AI è ancora apparsa. La cifra del 26 percento, al ritmo con cui è cresciuta, è un’istantanea piuttosto che un tetto.

Tag: , , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.