Cerebras CS-4: inferenza fino a 30 volte più rapida delle GPU
Cerebras ha avviato le prime spedizioni del CS-4, un acceleratore AI rack-scale costruito attorno a tre chip Wafer Scale Engine 3 Turbo. Il sistema eroga 750 PFLOPS di calcolo AI con 129,6 petabyte al secondo di banda di memoria, e dichiara un’inferenza fino a 30 volte più veloce rispetto ai sistemi GPU in produzione.
Il salto prestazionale ha radici architetturali precise. La latenza wafer-to-wafer scende a 2 microsecondi, e l’alimentazione arriva a soli 0,5 millimetri dal processore — circa cento volte più vicina rispetto a una scheda GPU convenzionale — riducendo quasi a zero le perdite di potenza a livello di board. Il risultato è un sistema in grado di superare 1.000 token al secondo su modelli con oltre 10 trilioni di parametri, mantenendo prestazioni interattive anche a quella scala.
Sul fronte dell’efficienza energetica, Cerebras dichiara fino a 10 volte più throughput per watt rispetto al predecessore CS-3. La piattaforma Nexus semplifica il deployment nei datacenter hyperscale attraverso un design modulare — Compute, Power, I/O — che riduce i tempi di installazione da giorni a ore.
L’implicazione più rilevante riguarda i sistemi agentici: latenze così basse offrono ai modelli margine reale per ragionamento in più passaggi, verifica dei risultati e uso di strumenti esterni senza degradare l’esperienza utente. Vale notare che i confronti prestazionali si basano su test interni o benchmark di terze parti, e i risultati effettivi dipendono da configurazione e workload specifici.