Abstract
Tra agosto e settembre 2026, Anthropic, OpenAI e i principali laboratori AI cinesi hanno rilasciato una serie di modelli che stanno ridefinendo le aspettative su costo, capacità e apertura. Questo articolo riporta i fatti accertati: cosa è uscito, cosa dicono i benchmark, come si confrontano i modelli tra loro, e perché la distanza dall'AGI rimane sostanzialmente invariata nonostante il marketing.
1. Cosa è uscito di recente
Anthropic: Claude Fable 5.1 e Mythos 5.1
Data di rilascio: 1 settembre 2026
Anthropic ha lanciato due varianti dello stesso modello con livelli di safeguard diversi:
- Claude Fable 5.1: disponibilità generale tramite Claude API, AWS Bedrock, Google Cloud e Microsoft Foundry.
- Claude Mythos 5.1: accesso ristretto a organizzazioni statunitensi certificate nel settore cybersecurity e life sciences.
Specifiche principali:
- Finestra di contesto da 1 milione di token, output massimo 128.000 token
- Adaptive thinking sempre attivo
- Knowledge cutoff: giugno 2026
- Disponibilità garantita fino ad almeno il 1° settembre 2027
Prezzi:
- Input: $10 per milione di token
- Output: $50 per milione di token
- Cache reads: $0.25 per milione di token (riduzione del 75% rispetto a Fable 5)
Prestazioni rispetto a Fable 5:
- Terminal-Bench-Science 0.1: 52,6% vs. 24,7%
- Terminal-Bench 4.0: 55,8% vs. 42,0%
- CursorBench 3.2.0: 73,4% vs. 70,5%
- AutomationBench: 31,4% vs. 17,1%
Anthropic riporta che Fable 5.1 batte il proprio Opus 5 su ogni benchmark pubblicato, nonostante Opus 5 costi la metà per token. Il modello attiva anche il 60% in meno di interventi delle safeguard cyber e l'85% in meno per le safeguard sulla biologia rispetto a Fable 5. Enterprise Frontier Safeguards, che permettono ai clienti di conservare i dati sulla propria infrastruttura cloud, saranno disponibili a partire dall'autunno 2026.
OpenAI: GPT-6 Astra
Data di rilascio: 3 settembre 2026 (anteprima limitata)
OpenAI ha iniziato il rollout di GPT-6 Astra, definendolo un "salto generazionale". Il presidente Greg Brockman ha parlato di "ingresso nell'era AGI". Il modello è disponibile per utenti Pro, Enterprise e Business Premium.
Cosa lo distingue:
- Primo modello OpenAI a raggiungere la soglia "Critical" per le capacità cybersecurity nel Preparedness Framework interno.
- Utilizza una tecnica chiamata "recurrent depth", che alcuni esperti di sicurezza AI hanno segnalato come potenzialmente più difficile da controllare.
- OpenAI ha pubblicato un avvertimento esplicito sulle capacità cyber avanzate prima del rilascio.
- Più veloce e versatile delle versioni precedenti, secondo l'azienda.
OpenAI non ha ancora pubblicato benchmark dettagliati confrontabili con quelli di Anthropic. La copertura iniziale si concentra soprattutto sulle implicazioni di sicurezza più che sulle prestazioni quantitative.
I contendenti cinesi
Alibaba: Qwen3.8-Max e Qwen3.8-Flash
Qwen3.8-Max (3 agosto 2026):
- 2,4 trilioni di parametri totali, circa 95 miliardi attivi per query
- Multimodale: input di testo, immagini e video
- Finestra di contesto da 1 milione di token, prezzo flat
- Prezzi API: $2 per milione di token in input, $6 per milione in output
- Cache input: $0,25 per milione di token
I benchmark self-reported da Alibaba includono Terminal-Bench 2.1 a 86,6 e GPQA Diamond a 92,6. Il modello ha raggiunto il primo posto tra i modelli testuali cinesi su Arena.AI, ma rimane dietro a Claude Fable 5 e a diverse varianti Opus di Anthropic nella classifica globale. I pesi open sono stati promessi a breve.
Qwen3.8-Flash (26 agosto 2026):
- 125 miliardi di parametri totali, solo 6 miliardi attivi per token
- Anteprima open-weight della prossima architettura Qwen4
- Prezzi API: $0,15 per milione di token in input, $0,47 per milione in output
- SWE-bench Pro: 62,5% contro il 55,4% di DeepSeek V4 Pro
- Batte DeepSeek V4 Flash sulla maggior parte dei benchmark di coding e attività d'ufficio pubblicati da Alibaba
DeepSeek: V4-Flash
Data di rilascio: 31 luglio 2026
- Modello open-weight mixture-of-experts
- Prezzi API: $0,14 per milione di token in input, $0,28 per milione in output
- Artificial Analysis Intelligence Index: circa 52-54
- SWE benchmark: circa 80,6% al lancio
- Prezzi di cache estremamente bassi
A metà agosto 2026 DeepSeek ha aumentato i prezzi di output di V4-Flash fino al 371% nelle ore di punta. Piattaforme terze hanno offerto hosting più economico, ma il modello rimane il leader di prezzo.
Zhipu: GLM-5.3-Flash
Data di rilascio: Fine agosto 2026
- 320 miliardi di parametri totali, 18 miliardi attivi (320B-A18B)
- Open-weight
- Finestra di contesto da 1 milione di token
- Prezzi dichiarati a un decimo di GLM-5.3 e a un ventesimo di Claude Opus 4.8
- Prestazioni di programmazione descritte come comparabili a Claude Opus 4.8 nel benchmark interno Z.ai Code Bench
2. Come stanno evolvendo
Il ritmo di rilascio accelera
I rilasci principali avvengono ogni 3-4 mesi, non annualmente. Fable 5 è uscito a giugno 2026; Fable 5.1 è arrivato il 1° settembre. DeepSeek V4 ad aprile; V4-Flash a fine luglio. Il settore è in una fase di iterazione rapida, non di stasi.
La vera competizione è l'efficienza, non solo la scala
I numeri di punta continuano a enfatizzare i parametri totali, ma la storia operativa è quella dei parametri attivi per token. Qwen3.8-Flash attiva solo 6 miliardi di parametri pur avendone 125 miliardi totali, e batte DeepSeek V4 Pro su SWE-bench Pro a un quarto del costo. DeepSeek V4-Flash fa lo stesso con i workload agentici a prezzi commodity. La tendenza è verso architetture più intelligenti, non semplicemente modelli più grandi.
La compressione dei prezzi è strutturale
Claude Fable 5 costava $10/$50 per milione di token. DeepSeek V4-Flash è entrato a $0,14/$0,28. Qwen3.8-Flash è ancora più economico. I laboratori cinesi usano strategie open-weight e prezzi aggressivi per guadagnare quote tra gli sviluppatori, mentre i laboratori occidentali mantengono i premium puntando su sicurezza, affidabilità ed ecosistema.
Open-weight è il default per gli sfidanti
Ogni rilascio cinese significativo è open-weight: DeepSeek V4, Qwen3.8-Flash-Next, GLM-5.3-Flash. I modelli frontier occidentali rimangono chiusi. Questo crea due mercati paralleli: modelli closed premium per use case regolamentati, e modelli open-weight per deployment con costi sensibili o self-hosted.
3. AGI: cos'è e quanto siamo vicini
AGI significa Artificial General Intelligence: un sistema capace di svolgere qualsiasi compito intellettuale umano—ragionare trasversalmente tra domini, trasferire l'apprendimento, impostare obiettivi propri e operare con vera autonomia. È diverso dai modelli attuali, che sono narrow AI: straordinariamente capaci in distribuzioni specifiche, ma dipendenti da prompt engineering, fine-tuning e supervisione umana per generalizzare.
Nonostante il linguaggio marketing di OpenAI su Astra—"benvenuti nell'era AGI"—non esiste consenso scientifico che l'AGI sia stata raggiunta. I modelli discussi qui sono impressionanti su benchmark, ma i benchmark misurano compiti specifici, non agenzia cognitiva generale. Un modello che punteggia alto su coding, matematica e domande a scelta multipla richiede ancora routing esplicito, layer di sicurezza e gate di approvazione umana per funzionare in workflow complessi.
Una lettura onesta è che siamo in una fase di compressione della frontier capability: il divario tra i migliori modelli chiusi e i migliori modelli open-weight si riduce su compiti specifici, e il costo di un'AI competente si avvicina a zero. Questo è uno spostamento strutturale nell'economia del deployment AI, non l'arrivo dell'intelligenza generale.
4. Confronto diretto
| Dimensione | Claude Fable 5.1 | GPT-6 Astra | Qwen3.8-Max | DeepSeek V4-Flash |
|---|---|---|---|---|
| Rilascio | 1 set 2026 | 3 set 2026 (limitato) | 3 ago 2026 | 31 lug 2026 |
| Contesto | 1M token | Non dichiarato | 1M token flat | Contesto lungo |
| Output max | 128K token | Non dichiarato | 131.072 token | Non dichiarato |
| Input / 1M | $10,00 | Non dichiarato | $2,00 | $0,14 |
| Output / 1M | $50,00 | Probabilmente premium | $6,00 | $0,28 |
| Cache read / 1M | $0,25 | Sconosciuto | $0,25 | Molto basso |
| Pesi | Chiusi | Chiusi | Open-weight promessi | Open-weight |
| Multimodale | No | Sconosciuto | Sì (testo/immagini/video) | Principalmente testo |
| Coding benchmark | Terminal-Bench 4.0: 55,8% | Non pubblicato | Terminal-Bench 2.1: 86,6% (vendor) | SWE ~80,6% (vendor) |
| Postura sicurezza | Safeguard ridotte; variante Mythos ristretta | Soglia Critical; avvisi safety | Meno documentata nelle fonti esaminate | Meno documentata nelle fonti esaminate |
| Ideale per | Coding e knowledge work di lunga durata con safeguard forti | Task ad alto rischio che richiedono capability frontier; valutazioni safety-critical | Lavoro professionale multimodale e lungo contesto | Workload agentici e coding cost-sensitive |
Nota importante:
- I benchmark non sono direttamente confrontabili perché derivano da test diversi.
- I punteggi di Qwen3.8-Max e DeepSeek V4-Flash sono vendor-reported o basati su index terzi; quelli di Fable 5.1 lo sono anch'essi, ma con note metodologiche più dettagliate.
- Le prestazioni di Astra non sono ancora state pubblicate in dettaglio da fonti indipendenti.
- Lo status open-weight dei modelli cinesi permette valutazioni indipendenti, ma il processo è ancora in corso.
5. Cosa cambia per sviluppatori e imprese
Ora hai scelte reali
Cinque anni fa il deployment AI serio significava OpenAI o niente. Oggi lo scenario include:
- Modelli closed premium (Fable 5.1, probabilmente Astra) per i casi in cui sicurezza, affidabilità ed ecosistema maturo sono prioritari.
- Sfidanti open-weight (DeepSeek V4-Flash, Qwen3.8-Flash, GLM-5.3-Flash) per workload cost-sensitive o self-hosted.
- Architetture efficiency-first che attivano una frazione dei parametri per token, rendendo seria l'AI su hardware consumer.
Il costo non è più una scusa valida
A $0,14 per milione di token in input, DeepSeek V4-Flash rende economicamente viable cicli agentici, classificazione su scala e bozze iterative anche per team piccoli. Qwen3.8-Flash a $0,15/M porta prestazioni di coding vicine alla frontier a prezzi simili. Il vero costo non è più l'API: è il design dell'integrazione e la supervisione umana.
Open-weight cambia il modello di deployment
Quando i pesi sono scaricabili, le organizzazioni possono:
- Fare fine-tuning per linguaggi specifici del dominio
- Eseguire inference on-premise per la residenza dei dati
- Quantizzare e servire il modello su GPU consumer
- Evitare il lock-in dei contratti API
Il trade-off è che i modelli open-weight tipicamente offrono meno documentazione formale sulla sicurezza e meno garanzie di supporto enterprise rispetto ai modelli frontier chiusi.
La superficie di sicurezza si espande
La strategia a doppio rilascio di Fable 5.1 (pubblico vs. Mythos ristretto) segnala che i vendor trattano i modelli ad alta capacità come sostanze controllate. La classificazione "Critical" di Astra e gli avvisi pubblici di OpenAI rappresentano un nuovo livello di trasparenza—o almeno di comunicazione—sulla sicurezza. Per le imprese, documentazione di sicurezza, audit trail e impegni sul trattamento dei dati dovrebbero essere requisiti first-class, non dettagli secondari.
6. Conclusione: evoluzione esponenziale o rendimenti decrescenti?
Le evidenze supportano un progresso rapido e non lineare su assi specifici—costo, efficienza e apertura—ma non un progresso esponenziale verso l'AGI.
- Costo: crollo esponenziale. Da $10/M input per Fable 5 a $0,14/M per DeepSeek V4-Flash in meno di quattro mesi.
- Efficienza: miglioramento non lineare. 6 miliardi di parametri attivi che battono 49 miliardi attivi su benchmark di coding suggerisce che l'innovazione architetturale sta superando lo scaling brute-force.
- Capacità: avanza, ma la frontier si consolida. Fable 5.1 rimane leader su più benchmark di coding, e nessun modello open-weight ha punteggi verificati indipendentemente che lo superino chiaramente su tutti i fronti.
La distanza dall'AGI rimane quella di prima: sconosciuta, e probabilmente misurata in anni, non in mesi. Ciò che è cambiato è che l'AI competente e narrow è ora una commodity. Il vantaggio competitivo si è spostato dall'accesso al modello all'orchestrazione, alla qualità dei dati, al design dei workflow e alle infrastrutture di fiducia.
Per gli sviluppatori, il messaggio è pratico: smettete di inseguire il modello "migliore" e iniziate a costruire sistemi multi-modello che instradano i compiti allo strumento giusto per il prezzo giusto. L'era del modello-unico-per-tutto sta finendo; l'era del modello-come-commodity è iniziata.
Fonti
- Anthropic Fable 5.1 / Mythos 5.1:
- MLQ AI: https://mlq.ai/news/anthropic-launches-claude-fable-51-with-cheaper-cached-inputs-and-new-migration-requirements
- Tech Insider: https://tech-insider.org/anthropic-claude-fable-5-1-mythos-5-1-launch-2026
- TrendyTechTribe: https://trendytechtribe.com/ai/claude-fable-5-1-mythos-5-1-launch
- Yahoo Tech: https://tech.yahoo.com/ai/claude/articles/anthropic-launches-claude-fable-5-182403780.html
- OpenAI GPT-6 Astra:
- CNBC: https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html
- Axios: https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman
- Reuters: https://www.reuters.com/legal/litigation/openai-launches-new-astra-model-amid-growing-scrutiny-over-agents-safety-2026-09-03/
- Wikipedia: https://en.wikipedia.org/wiki/GPT-6_Astra
- Alibaba Qwen3.8:
- Reuters: https://www.reuters.com/business/retail-consumer/alibaba-unveils-its-most-capable-ai-model-date-not-far-behind-moonshots-size-2026-08-03/
- Bloomberg: https://www.bloomberg.com/news/articles/2026-08-26/alibaba-releases-smaller-cost-effective-qwen-ai-model
- SCMP: https://www.scmp.com/tech/tech-trends/article/3364404/alibabas-lightweight-qwen-model-takes-larger-ai-systems-openai-deepseek-zhipu
- 36Kr: https://eu.36kr.com/en/p/3956555141430402
- Vector Wire: https://vectorwire.ai/article/chinese-open-weight-labs-close-in-on-frontier-models-across-vision-and-coding-588e3d
- Intelligent Living: https://www.intelligentliving.co/qwen38-flash-matches-deepseek-v4-pro/
- OrcaRouter: https://www.orcarouter.ai/blog/qwen-3-8-vs-deepseek-v4
- Volanea: https://www.volanea.com/blog/qwen-3-8-max-vs-deepseek-v4-flash
- DeepSeek V4-Flash:
- Zhipu GLM-5.3-Flash:
Top comments (0)