
- 液冷 LPX 机架包含 256 颗由三星制造的 Groq 芯片,专为低延迟 AI 推理设计。
- 英伟达称,该机架每秒可处理 3,400 个 token,在原文与 Cerebras 驱动推理系统的对比中展现出量化的性能优势。
- 此次部署将英伟达以 200亿美元收购 Groq 资产所得的技术和人才实现商业化,该交易于 12 月宣布。
- 目前采用仍集中于一个明确点名的客户 Nebius,且该产品专注于推理,而非通用 AI 工作负载。
引述
“每秒 3,400 个 token”

“每秒 3,400 个 token”— 英伟达