Una cadena de inferencia divide el procesamiento de un gran prompt y la generación rápida de tokens entre dos motores de chipsIlustración histórica generada con IA · Dr.Sacred

Datos de ejemplo, no métricas históricas

146
37
10
504K

AMD y Cerebras dividen una respuesta de IA para que cada chip haga lo suyo

AMD leerá la petición y los documentos; Cerebras escribirá la respuesta a toda velocidad. Dividir el trabajo promete eficiencia, aunque la mejora anunciada todavía es una estimación de ambos fabricantes. La IA descubre la cadena de montaje: cada chip a lo suyo y nadie bloqueando la cinta.

¿Quieres un poco más de detalle?

La propuesta divide una respuesta en dos fases. Los sistemas de AMD leen la petición y los documentos; los de Cerebras se concentran en escribir la respuesta con rapidez. La oferta llegaría a clientes durante la segunda mitad de 2026. Ambas compañías calculan una mejora importante de velocidad y consumo, pero la cifra procede de una simulación conjunta, no de una prueba independiente en producción. La lógica empresarial es parecida a una cadena de montaje: asignar cada tarea al equipo que la realiza mejor puede aprovechar más la inversión existente. El coste oculto es la coordinación entre proveedores, programas y redes, que añade puntos de fallo y dependencia compartida. La fábrica puede correr más; alguien seguirá teniendo que responder cuando la cinta se pare.