30倍Token速度挑战GPU王座! 法巴盛赞CS-4开启“晶圆级+解耦式推理”纪元

发布时间:2026-08-20 21:46

  在人工智能芯片公司Cerebras Systems于周二举办了Supernova Day活动后,法国巴黎银行表示,该公司公布的合作伙伴和相关公告给其留下了深刻印象。

  法国巴黎银行分析师Karl Ackerman在给客户的一份报告中写道:“与英伟达的LPU一样,Cerebras与OpenAI、亚马逊AWS和AMD达成的新合作关系凸显出市场对改善推理过程中对延迟高度敏感的解码环节的需求正在不断增长。”

  分析师进一步表示,在快速推理方面,新近公布的基于SRAM的CS-4晶圆级引擎提供了“惊人的43.2 PB/s片上内存带宽”,并配备了一种利用RDMA的新型晶圆I/O接口。Cerebras自豪地表示,CS-4系统生成Token的速度比当前生产环境中的GPU系统快30倍。

  此外,分析师表示,Cerebras每年将性能提升一倍、并计划到2027年将吞吐量提高20倍的产品路线图令人钦佩。分析师称:“Cerebras正专注于解耦式推理,通过将其晶圆级引擎定位为超高速解码引擎,以实现快速Token生成,并与AWS Trainium或AMD Helios等计算密集型系统协同工作。Cerebras表示,其解耦式推理系统预计将比GPU快最高10倍,并且相较于仅采用WSE的配置,性能提升5倍。”

  最后,分析师表示,Arista Networks已经成为Cerebras的“关键”网络合作伙伴,并预计随着时间推移,这一合作关系将帮助Arista拓展新的客户应用场景。

  Cerebras宣称CS-4在推理速度方面树立了新的行业标杆。在GPT-OSS-120B模型上的直接对比测试中,CS-4每用户每秒可生成超过4,400个Token,最高达到GPU方案的30倍。系统可支持超过50万亿参数的模型。与前代CS-3相比,CS-4速度提升两倍,每瓦吞吐量提升10倍,显著改善数据中心的经济效益。

排行

精选