Cerebras CS-4发布:750 PFLOPS晶圆级推理挑战英伟达
2026年8月18日,Cerebras Systems 在 SUPERNOVA 2026 大会上发布 CS-4 机架级 AI 推理系统。官方宣称其 GPT-OSS-120B 模型单用户推理速度超过 4400 token/秒,最高可达 GPU 方案的 30 倍,首批设备将于本季度出货。
三颗晶圆一柜,750 PFLOPS 的物理极限
CS-4 的核心是三颗 WSE-3 Turbo(WSE-3T)晶圆级引擎。每颗晶圆集成 4 万亿晶体管、90 万个 AI 优化核心和 44GB 片上 SRAM,单颗算力 250 PFLOPS。三颗合并后,一个机柜提供 750 PFLOPS AI 算力、129.6 PB/s 内存带宽和 7.2 Tb/s 系统 I/O。Cerebras 表示,这套系统可支持超过 50 万亿参数的模型,晶圆间延迟低至 2 微秒。
为什么这组数字值得关注?大模型推理的瓶颈通常不在算力,而在内存带宽。GPU 集群需要把权重在数千颗芯片之间搬运,每次跨芯片通信都要付出网络延迟代价。Cerebras 把整个模型放在一块晶圆内计算,几乎消除了芯片间数据搬运。晶圆间 2 微秒延迟,让多柜扩展时仍能保持接近单机的响应速度。
没有新制程,速度翻倍来自工程重构
出人意料的是,WSE-3T 并未采用新制程。它仍然基于台积电 5nm 工艺,晶体管数量和核心数与上一代 WSE-3 相同。性能提升来自封装与供电重构。
Cerebras 把电压转换模块移到距晶圆仅 0.5 毫米的位置,而传统 GPU 板的供电距离约为 50 毫米。这个改动几乎消除了板级功率损耗,使系统可以向晶圆输送双倍电力,从而把时钟频率从约 1.4 GHz 提升到 2.8 GHz。CS-4 因此实现了两倍于 CS-3 的速度,同时功耗控制在 120–140 kW,约为同类英伟达/AMD 机柜的一半。
Nexus 机架架构把计算、供电、I/O 拆成可独立升级的模块,”Wafer-Scale Backpack” 组件数量比上一代减少 50%,部署时间从几天缩短到几小时。Cerebras 还支持与 AMD Helios、AWS Trainium 等预填充硬件做”解耦推理”,客户不必绑定全栈。
Agent 工作流需要的不只是总吞吐量
Cerebras 把卖点放在”每用户 token 速度”,而不是传统数据中心偏好的总吞吐量。CTO Sean Lie 解释:30 倍速度意味着 Agent 系统在同样时间内可以完成多一个数量级的推理、验证或工具调用。
这个定位切中了当前 AI 应用的痛点。一个编程 Agent 读取代码库、规划修改、执行测试的循环里,模型等待时间往往占掉大部分。推理速度从几十 token/秒提升到几千 token/秒,交互体验会从”批处理”变成”实时协作”。Cerebras 已经与 Lovable、Cognition、Tavus 等客户合作,验证低延迟 Agent 场景。
对英伟达的真正威胁是商业模式
CS-4 的直接竞争对手是英伟达的 GPU 推理集群。Cerebras 宣称每瓦吞吐量是上一代 CS-3 的 10 倍,这让数据中心在电费压力下多了一个选择。但英伟达的优势不只在芯片性能,还在于 CUDA 生态和全球云厂商的部署规模。
Cerebras 的机遇在于:当模型参数膨胀到 10 万亿、50 万亿级别时,传统 GPU 集群的网络开销会急剧放大。DeepSeek V4 Pro、字节 10 万亿参数模型、Anthropic Mythos 5 等超大模型陆续出现,推理侧的硬件瓶颈正在从”算力够不够”转向”延迟能不能接受”。CS-4 试图用晶圆级集成回答这个问题。
CS-4 的检验标准不在发布会上,而在 Q3 出货后的真实工作负载里。晶圆级集成能不能从实验室方案变成主流推理基础设施,未来 6 个月会见分晓。