跳至正文
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
AI行业动态

Cerebras CS-4发布:750 PFLOPS晶圆级推理挑战英伟达

作者 admin
2026-08-20 1 分钟阅读
0

2026年8月18日,Cerebras Systems 在 SUPERNOVA 2026 大会上发布 CS-4 机架级 AI 推理系统。官方宣称其 GPT-OSS-120B 模型单用户推理速度超过 4400 token/秒,最高可达 GPU 方案的 30 倍,首批设备将于本季度出货。

Table of Contents

Toggle
  • 三颗晶圆一柜,750 PFLOPS 的物理极限
  • 没有新制程,速度翻倍来自工程重构
  • Agent 工作流需要的不只是总吞吐量
  • 对英伟达的真正威胁是商业模式

三颗晶圆一柜,750 PFLOPS 的物理极限

CS-4 的核心是三颗 WSE-3 Turbo(WSE-3T)晶圆级引擎。每颗晶圆集成 4 万亿晶体管、90 万个 AI 优化核心和 44GB 片上 SRAM,单颗算力 250 PFLOPS。三颗合并后,一个机柜提供 750 PFLOPS AI 算力、129.6 PB/s 内存带宽和 7.2 Tb/s 系统 I/O。Cerebras 表示,这套系统可支持超过 50 万亿参数的模型,晶圆间延迟低至 2 微秒。

为什么这组数字值得关注?大模型推理的瓶颈通常不在算力,而在内存带宽。GPU 集群需要把权重在数千颗芯片之间搬运,每次跨芯片通信都要付出网络延迟代价。Cerebras 把整个模型放在一块晶圆内计算,几乎消除了芯片间数据搬运。晶圆间 2 微秒延迟,让多柜扩展时仍能保持接近单机的响应速度。

没有新制程,速度翻倍来自工程重构

出人意料的是,WSE-3T 并未采用新制程。它仍然基于台积电 5nm 工艺,晶体管数量和核心数与上一代 WSE-3 相同。性能提升来自封装与供电重构。

Cerebras 把电压转换模块移到距晶圆仅 0.5 毫米的位置,而传统 GPU 板的供电距离约为 50 毫米。这个改动几乎消除了板级功率损耗,使系统可以向晶圆输送双倍电力,从而把时钟频率从约 1.4 GHz 提升到 2.8 GHz。CS-4 因此实现了两倍于 CS-3 的速度,同时功耗控制在 120–140 kW,约为同类英伟达/AMD 机柜的一半。

Nexus 机架架构把计算、供电、I/O 拆成可独立升级的模块,”Wafer-Scale Backpack” 组件数量比上一代减少 50%,部署时间从几天缩短到几小时。Cerebras 还支持与 AMD Helios、AWS Trainium 等预填充硬件做”解耦推理”,客户不必绑定全栈。

Agent 工作流需要的不只是总吞吐量

Cerebras 把卖点放在”每用户 token 速度”,而不是传统数据中心偏好的总吞吐量。CTO Sean Lie 解释:30 倍速度意味着 Agent 系统在同样时间内可以完成多一个数量级的推理、验证或工具调用。

这个定位切中了当前 AI 应用的痛点。一个编程 Agent 读取代码库、规划修改、执行测试的循环里,模型等待时间往往占掉大部分。推理速度从几十 token/秒提升到几千 token/秒,交互体验会从”批处理”变成”实时协作”。Cerebras 已经与 Lovable、Cognition、Tavus 等客户合作,验证低延迟 Agent 场景。

对英伟达的真正威胁是商业模式

CS-4 的直接竞争对手是英伟达的 GPU 推理集群。Cerebras 宣称每瓦吞吐量是上一代 CS-3 的 10 倍,这让数据中心在电费压力下多了一个选择。但英伟达的优势不只在芯片性能,还在于 CUDA 生态和全球云厂商的部署规模。

Cerebras 的机遇在于:当模型参数膨胀到 10 万亿、50 万亿级别时,传统 GPU 集群的网络开销会急剧放大。DeepSeek V4 Pro、字节 10 万亿参数模型、Anthropic Mythos 5 等超大模型陆续出现,推理侧的硬件瓶颈正在从”算力够不够”转向”延迟能不能接受”。CS-4 试图用晶圆级集成回答这个问题。

CS-4 的检验标准不在发布会上,而在 Q3 出货后的真实工作负载里。晶圆级集成能不能从实验室方案变成主流推理基础设施,未来 6 个月会见分晓。

作者

admin

关注我
其他文章
上一个

DeepSeek Harness开源一周星标15万:插件底座改写Agent规则

下一个

Anthropic年化营收650亿反超OpenAI:史上最大IPO倒计时,AI双雄命运分化

近期文章

  • 英伟达35亿美元入股联发科:定制AI芯片战正式打响
  • 前英伟达VP带9000万美元出逃:Veeda押注”世界模型”成具身智能新基建
  • OpenAI自研芯片Jalapeno实测跑赢英伟达:AI推理成本战正式打响
  • AI吞噬现金流:中美巨头单季烧掉1318亿,自由现金流集体转负
  • Anthropic发布MHS标准:AI智能体首次跨入物理世界操控机械臂

归档

  • 2026 年 9 月
  • 2026 年 8 月
  • 2026 年 7 月
  • 2026 年 6 月
  • 2026 年 5 月
  • 2020 年 1 月

分类

  • AI大模型
  • AI工具测评
  • AI教育
  • AI硬件/芯片
  • AI编程工具
  • AI行业动态
  • AI设计/创作
  • SEO/搜索优化
  • 科技教育
  • 科技资讯
  • 赚钱攻略
  • 软件推荐
Copyright 2026 — 78227科技派. All rights reserved. Blogsy WordPress Theme