IA

Claude Opus 5.5 arriva più economico del 40% mentre Anthropic chiede cautela sull’IA

Susan Hill
Aggiungici su Google

Claude Opus 5.5 fa qualcosa che i precedenti modelli di Anthropic non facevano: costa meno e funziona più velocemente, pur eguagliando o superando un sistema più grande e più costoso. Il modello gestisce il coding agentico, l’uso del computer, la lettura dei grafici e il ragionamento multidisciplinare a livelli che, secondo i dati di Anthropic stessa, superano quelli di Claude Fable 5.1, il modello finora più capace dell’azienda, in diversi parametri. Per utenti e sviluppatori che ritenevano Opus 5 utile ma costoso, il divario fra ciò che il modello sa fare e il suo prezzo è cambiato in modo significativo.

La differenza di prezzo è precisa. Opus 5.5 costa 4 dollari per milione di token in input e 20 dollari per milione di token in output; Opus 5 costava rispettivamente 5 e 25 dollari. Le letture dalla cache scendono da 0,50 a 0,20 dollari per milione di token. Anthropic afferma che i carichi di lavoro tipici risultano complessivamente circa il 40% meno costosi. Anche la velocità va nella stessa direzione: il modello standard genera testo oltre il 30% più rapidamente di Opus 5. Un’opzione separata in modalità veloce, al prezzo di 8 dollari per l’input e 40 dollari per l’output per milione di token, raggiunge fino a 2,5 volte la velocità di Opus 5 standard, un’impostazione utile per le applicazioni sensibili alla latenza.

I dati prestazionali pubblicati da Anthropic collocano Opus 5.5 davanti a Fable 5.1, Opus 5 e GPT-6 Astra in quattro benchmark su sei. In Terminal-Bench 4.0, che testa l’esecuzione del codice in un ambiente terminale reale, Opus 5.5 ottiene il 66,4% contro il 55,8% di Fable 5.1. In Humanity’s Last Exam, un test che spazia fra conoscenze accademiche e professionali in diverse discipline, il risultato è 67,7% contro 65,6%. OSWorld 2.0, che misura l’operatività sulle interfacce dei computer, mostra 81,8% contro 80,7%. Un test di Deloitte ha rilevato che Opus 5.5, con l’impostazione di sforzo più bassa, ha individuato il 72% degli errori di coding noti in fase di revisione, contro il 56% di Opus 5 con sforzo elevato. Questi numeri provengono da Anthropic e dai partner da essa selezionati; i margini d’errore dichiarati vanno da ±1,6 a ±5 punti percentuali e, al momento del lancio, non è stata pubblicata alcuna verifica indipendente da parte di terzi.

Due aree interrompono questo schema. In AutomationBench, GPT-6 Astra ottiene il 41,4% contro il 40,0% di Opus 5.5. In Terminal-Bench-Science, il divario è più ampio: Astra raggiunge il 64,6%, mentre Opus 5.5 si ferma al 58,7%. Entrambe le differenze rientrano nei margini d’errore dichiarati — potrebbero essere rumore statistico — ma potrebbero anche non esserlo. Anthropic include queste righe nella propria tabella pubblicata, cosa che al lancio fa più di quanto facciano la maggior parte delle aziende di IA. I numeri necessitano comunque di un esame indipendente prima di poter essere considerati definitivi.

Sul fronte della sicurezza, Anthropic afferma che Opus 5.5 è stato valutato prima della pubblicazione da team esterni, fra cui METR. Nel suo audit comportamentale interno, composto da quasi 2.000 scenari progettati per verificare se il modello tenti di aggirare i vincoli impostigli, Opus 5.5 viene descritto come l’85% meno propenso di Opus 5 a tentare tale elusione. I modelli più potenti tendono a essere più capaci di trovare soluzioni alternative, il che rende il miglioramento significativo se verrà confermato. L’esperienza di impiego sarà il vero banco di prova.

Ciò che rende insolito questo lancio è la sua tempistica. All’inizio di questo mese, il CEO di Anthropic Dario Amodei ha pubblicato un saggio nel quale scriveva di essersi convinto che affrontare pienamente i rischi dell’IA richieda di «regolare il ritmo dell’avanzamento delle capacità affinché la prevenzione dei rischi abbia il tempo di tenere il passo». Sam Altman di OpenAI ed Elon Musk hanno espresso accordo con la preoccupazione generale. Jensen Huang di Nvidia ha affermato che la scienza alla base non la sostiene. E poi Anthropic ha distribuito un modello più veloce, più economico e più capace del suo predecessore. Una lettura possibile: un modello con migliori valutazioni di sicurezza e un accesso più ampio è precisamente ciò che Amodei aveva in mente. Un’altra: il saggio indicava come preoccupazione l’avanzamento delle capacità, e le capacità sono avanzate. Entrambe le letture rientrano nello stesso insieme di fatti, e i soli benchmark di Anthropic non possono stabilire quale sia quella corretta.

Claude Opus 5.5 è disponibile dal 22 settembre 2026 con l’ID modello API claude-opus-5-5. Funziona all’interno di Claude nei piani Pro, Max, Team ed Enterprise, ed è accessibile tramite AWS, Google Cloud e Microsoft Azure. Anthropic sta aumentando i limiti di utilizzo per i livelli di abbonamento di cinque ore. Sonnet 5.5 e Haiku 5.5, gli altri membri della famiglia 5.5, dovrebbero seguire nelle prossime settimane, senza che per nessuno dei due siano stati annunciati prezzi o una data di rilascio specifica.

Tag: , , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.