Claude Haiku 5.5 è il nuovo modello di Anthropic per lavori rapidi, ripetitivi e ad alto volume. Presentato il 7 ottobre 2026, introduce prezzi più bassi e uno sforzo di ragionamento regolabile: l’interesse concreto è capire quali attività si possano spostare su un modello economico senza peggiorare il risultato.
Non è una sostituzione automatica di Sonnet o Opus. Un compito circoscritto, come riassumere un documento o classificare richieste, ha requisiti diversi da una modifica complessa a un software. Il costo va confrontato con gli errori, le ripetizioni e il tempo necessario per controllare l’output.
Claude Haiku 5.5: prezzi sotto e sopra 100.000 token
La tabella ufficiale dei prezzi distingue due fasce in base alla lunghezza del prompt. La soglia è importante: la tariffa più bassa non va applicata indistintamente a richieste lunghe.
| Voce, per milione di token | Prompt fino a 100.000 token | Prompt oltre 100.000 token |
|---|---|---|
| Input | 0,10 dollari | 0,50 dollari |
| Output | 0,50 dollari | 2,50 dollari |
| Lettura cache | 0,01 dollari | 0,05 dollari |
| Scrittura cache a 5 minuti | 0,125 dollari | 0,625 dollari |
I valori riguardano il listino API indicato, non il prezzo dell’abbonamento alla chat. Durata della cache, elaborazione regionale, piattaforma cloud e condizioni applicabili possono modificare la fattura: per un preventivo serve il percorso di utilizzo effettivo.
Un esempio puramente aritmetico: un milione di token di input non in cache e 200.000 token di output, distribuiti su richieste nella fascia fino a 100.000, costano 0,20 dollari secondo queste due voci. Lo stesso volume nella fascia superiore costa 1 dollaro, prima di servizi aggiuntivi, imposte o altre condizioni.
Perché “90% in meno” e “75% in meno” non sono la stessa promessa
Nell’annuncio di lancio, Anthropic distingue la riduzione delle tariffe dal risparmio medio stimato rispetto a Haiku 4.5. La percentuale sul singolo token non descrive da sola il costo di completare un lavoro.
Un modello può utilizzare più token, un diverso livello di sforzo o più tentativi. Per questo non basta moltiplicare la vecchia fattura per uno sconto: bisogna misurare il proprio carico, compresa la quota di richieste che supera la soglia.
Una prova utile prende un campione reale e conserva prompt, risultato atteso, token e necessità di revisione. Se il modello economico richiede spesso una seconda chiamata al modello grande, il risparmio resta possibile ma va calcolato sull’intera catena.
Sforzo regolabile: una scelta da testare
La documentazione sull’effort spiega il controllo dello sforzo supportato dai modelli compatibili. Per chi costruisce un servizio, il punto è trovare il livello sufficiente per il compito, non impostare sempre quello più alto.
Una categorizzazione semplice potrebbe non beneficiare dello stesso lavoro di ragionamento richiesto da un caso ambiguo. Valuta separatamente gli esempi facili e quelli difficili: una media buona può nascondere errori proprio nelle richieste che ti costano di più.
Prima di cambiare versione in produzione, consulta anche la guida di migrazione. Non assumere che compatibilità dei nomi significhi comportamento identico; controlla output, parametri e regressioni nel tuo ambiente.
Quando conviene usarlo come sottoagente
Il caso più interessante è dividere il lavoro per responsabilità. Un modello principale può coordinare una modifica, mentre un sottoagente riceve una domanda delimitata: individuare una convenzione, sintetizzare un file già selezionato o preparare una classificazione da verificare.
La nostra guida alle funzioni di Claude Code mostra perché memoria, contesto e limiti dei canali siano importanti. Un modello meno costoso non risolve un incarico mal definito: rischia soltanto di produrre più lavoro da controllare.
Evita di delegargli implicitamente autorizzazioni, cancellazioni o modifiche ai permessi. Il compito semantico può essere assegnato al modello; la decisione su un’azione sensibile deve restare nel processo che governa il sistema.
Sonnet resta diverso da Haiku
Il confronto corretto non è “quale vince sempre?”, ma “quale completa questo compito al costo accettabile?”. Un lavoro lungo con dipendenze fra molti file può giustificare un modello più capace; un’attività breve e verificabile può essere candidata a Haiku.
Anthropic ha anche ridotto le letture cache di Sonnet 5.5. Questo rende ancora meno utile scegliere soltanto sulla tariffa input: un agente che riutilizza molto contesto ha una composizione di costi diversa da una classificazione isolata.
Il metodo descritto nel nostro confronto fra modelli AI resta applicabile: costruire esempi rappresentativi e valutare errori, latenza e risultato, non trasferire un benchmark direttamente sul proprio progetto.
Cosa controllare prima di adottarlo
- Quante richieste superano davvero 100.000 token?
- Quali risultati possono essere controllati automaticamente?
- Quanto costa correggere una risposta sbagliata?
- Quando il lavoro deve passare a Sonnet, Opus o a una persona?
- Le condizioni del provider scelto coincidono con il listino confrontato?
Il modello è disponibile sulla Claude Platform con identificativo claude-haiku-5-5; per altri canali controlla catalogo e condizioni del servizio. La disponibilità del modello non equivale a una promessa di accesso illimitato da ogni abbonamento.
Claude Haiku 5.5 conta perché amplia le attività per cui un modello piccolo può essere economicamente sensato. Il vantaggio emerge quando il lavoro è delimitato, l’errore è osservabile e l’eventuale passaggio a un sistema più capace è previsto fin dall’inizio.
