POR QUÉ IMPORTA
Cerebras Systems anunció el 19 de agosto de 2026 el CS-4, su primer sistema en rack que combina tres obleas WSE-3 Turbo en paralelo, funcionando a 2,8 GHz, el doble de la velocidad de reloj de la WSE-3 original. Según el comunicado oficial de la empresa y la cobertura de The Next Platform y ServeTheHome, el CS-4 entrega hasta 30 veces más tokens por segundo por usuario que las soluciones basadas en GPU y hasta 10 veces más rendimiento por vatio que el CS-3, su predecesor, usando un 50% menos de componentes en el rack. Las primeras unidades deberían enviarse en el tercer trimestre de 2026.En este artículo
Un sistema pensado para la máxima escala de inferencia
Cerebras Systems anunció el 19 de agosto de 2026 el CS-4, apodado internamente Nexus, su primer sistema en rack en combinar tres obleas WSE-3 Turbo funcionando en paralelo. Según el comunicado oficial de la empresa y la cobertura de The Next Platform, la nueva oblea funciona a 2,8 GHz, el doble de la velocidad de reloj de la WSE-3 original, manteniendo los mismos 900.000 núcleos y 44 GB de memoria SRAM integrada en el propio chip.
Hasta 30 veces más rápido que las GPU en inferencia
El principal argumento de venta de Cerebras es el rendimiento en tokens por segundo por usuario, métrica central para quien ejecuta chatbots y agentes de IA en producción. Según la empresa, el CS-4 llega a ser hasta 30 veces más rápido que las soluciones basadas en GPU en esa métrica, además de entregar hasta 10 veces más rendimiento por vatio que el CS-3, la generación anterior, lo que reduce el costo energético por consulta procesada.
Rack Nexus: la mitad de las piezas, implementación más rápida
El nuevo diseño de rack, llamado Nexus, alberga tres mochilas de cómputo, el triple de la capacidad de los racks anteriores de la línea CS, usando un 50% menos de componentes. Según ServeTheHome, esa simplificación reduce el tiempo de instalación de días a horas y eleva en un 60% la automatización de manufactura, un factor relevante para clientes que necesitan escalar capacidad de inferencia rápidamente.
Soporte para modelos gigantes y primeras entregas en el tercer trimestre
El CS-4 fue diseñado para soportar modelos de más de 50 billones de parámetros, muy por encima de lo que exige hoy la mayoría de las cargas de trabajo comerciales, una señal de que Cerebras apuesta a un crecimiento continuo del tamaño de los modelos de frontera. Clientes seleccionados ya tienen acceso anticipado al sistema, y la disponibilidad general está prevista para el tercer trimestre de 2026, según el comunicado de la empresa.
Contexto: la disputa por reducir el costo de inferencia
El lanzamiento llega en medio de una disputa intensa entre proveedores de hardware de IA por reducir el costo por token procesado, con Nvidia, AMD y startups como Groq compitiendo por contratos de inferencia a gran escala. La apuesta de Cerebras por una arquitectura de oblea completa, en lugar de múltiples GPU interconectadas, es un intento de diferenciación técnica en ese mercado, aunque todavía depende de la adopción a gran escala por parte de los grandes proveedores de nube para volverse competitiva en costo total frente a alternativas ya consolidadas.
Por qué esto importa a agencias y pymes brasileñas
Para agencias que operan chatbots y agentes de atención con alto volumen de mensajes, el costo de inferencia suele pesar más en el presupuesto que el costo de entrenamiento de modelos. Hardware especializado como el CS-4 tiende a presionar al mercado de proveedores de inferencia a bajar precios para competir, lo que podría reflejarse, con el tiempo, en planes más baratos de API usados a diario por operaciones brasileñas de automatización, aunque el acceso directo a este tipo de infraestructura siga restringido a pocos grandes proveedores de nube.