IA

Fable 5.1 di Anthropic taglia del 75% i costi di cache e più che raddoppia i punteggi agentici

Susan Hill

Anthropic ha aggiornato Claude il 1° settembre con Fable 5.1, riducendo il costo dei token di input in cache da $1,00 a $0,25 per milione — un taglio del 75% che arriva nel momento in cui la maggior parte degli sviluppatori di AI in produzione ha scoperto che l’accumulo di contesto, non la potenza di calcolo grezza, è dove si concentrano realmente i loro budget infrastrutturali. In una sessione agentica live, una singola conversazione di Claude può contenere centinaia di migliaia di token in cache mentre il contesto si accumula tra un turno e l’altro. A $0,25 per milione, quell’accumulo diventa una scelta progettuale deliberata, non un tetto di costo che uno sviluppatore deve aggirare.

I benchmark che accompagnano la variazione di prezzo mostrano miglioramenti prestazionali che rafforzano la convenienza economica. Su Terminal-Bench-Science 0.1, che misura il ragionamento scientifico multi-step richiedente progettazione sperimentale e analisi iterativa, Fable 5.1 ha ottenuto il 52,6% contro il 24,7% di Fable 5 — più che raddoppiando il risultato precedente. AutomationBench è passato dal 17,1% al 31,4%, e Terminal-Bench 4.0, una valutazione più ampia delle capacità agentiche, è salito dal 42,0% al 55,8%. CursorBench 3.2.0 ha raggiunto il 73,4%. Il trend su tutte e quattro le valutazioni è coerente: Fable 5.1 non è marginalmente migliore, ma sostanzialmente più affidabile nelle categorie di compiti che definiscono il valore agentico.

L’effetto combinato riscrive l’aritmetica dei costi dello sviluppo con Claude. Un’applicazione agentica che completa un compito in meno turni — perché il modello è più affidabile — consuma meno cicli di token totali per arrivare a un risultato positivo. Applicando il taglio del 75% sulla cache ai token che effettivamente usa, la riduzione effettiva del costo per compito nei flussi di lavoro agentici ad alto riutilizzo raggiunge il 45% o più. Anthropic non ha pubblicato un unico numero headline per il risparmio complessivo, ma gli sviluppatori che modellizzano la propria economia dei token arriveranno a cifre in quell’intervallo per carichi di lavoro con contesto pesante.

Fable 5.1 è disponibile immediatamente tramite l’API diretta di Anthropic con l’identificativo del modello claude-fable-5-1, e tramite Amazon Web Services Bedrock, Google Cloud Platform e Microsoft Azure. Anthropic ha annunciato Enterprise Frontier Safeguards come funzionalità concomitante: conservazione dei dati controllata dal cliente, chiavi di crittografia gestite dal cliente e distribuzione all’interno del tenant cloud esistente di ciascun cliente, incluse senza costi aggiuntivi oltre ai costi cloud sottostanti.

Insieme al rilascio generale, Anthropic ha introdotto Mythos 5.1, una variante dello stesso modello di base che opera con quelle che l’azienda descrive come salvaguardie più permissive per organizzazioni verificate. L’accesso è limitato a istituti di ricerca in cybersecurity e aziende life-sciences verificati. L’azienda ha citato applicazioni dimostrate tra cui la progettazione di leganti proteici e l’ottimizzazione di modelli biologici con una velocità di inferenza fino a 2,5 volte superiore rispetto alla versione standard. L’accesso a Mythos 5.1 non è self-service: Anthropic esamina le singole richieste e non ha pubblicato la dimensione della coorte abilitata.

I numeri agentici di Fable 5.1, in particolare su Terminal-Bench-Science, collocano i risultati pubblicati da Anthropic davanti ai dati più recentemente divulgati da OpenAI in valutazioni comparabili. I confronti tra benchmark di fornitori diversi comportano cautele metodologiche — i vendor scelgono valutazioni che favoriscono i propri modelli, e i test specifici evidenziati da Anthropic sono stati presumibilmente scelti per i loro risultati favorevoli. Ciò che è più difficile da spiegare è il pattern interno di raddoppio: Fable 5.1 non è lo stesso modello con una riduzione di prezzo applicata. Il cambiamento nelle performance è abbastanza ampio da rendere impossibile separare la storia del prezzo dalla storia delle prestazioni.

Per gli sviluppatori che attualmente non usano Claude, la mossa sul prezzo della cache è il dato che vale la pena tradurre nella propria economia dei token. Qualsiasi fornitore di AI che non si avvicini a $0,25 per milione di token in cache dovrà ora affrontare domande dirette di confronto dei costi nelle conversazioni di vendita enterprise. Il prezzo della cache di Anthropic era già inferiore a quello di diversi concorrenti prima di questa riduzione; il divario si è ampliato. I miglioramenti prestazionali sono più difficili da generalizzare tra casi d’uso diversi, ma nel segmento agentico e del ragionamento scientifico, Fable 5.1 stabilisce un livello di benchmark che sarà il metro di paragone per la prossima grande release di qualsiasi fornitore.

Tag: , , , ,

Discussione

Ci sono 0 commenti.