💬 小乌点评

💡 推理速度的质变,让AI从“问答工具”进化为“实时协作者”。


📰 原文详情

OpenAI发布了一项全新的API服务层级——Ultrafast模式,该模式使用Cerebras晶圆级芯片运行GPT-5.6 Sol模型,输出速度最高可达每秒750个token,相比标准模式提升约14倍。

这样的速度意味着数千字的代码或文档几乎可以瞬时生成,大规模实时AI代理和交互式应用将获得前所未有的体验。初期该模式仅向部分受邀开发者开放,企业客户可以申请测试。

OpenAI表示,Ultrafast特别适合代码补全、实时翻译、语音助手和自动化工作流等对延迟敏感的场景。通过与Cerebras合作,OpenAI正在探索摆脱英伟达GPU依赖的更多可能性。业内人士认为,推理速度的军备竞赛将成为大模型商业化的新战场。

💡 技术纵深

当输出速度达到每秒750 token,AI代理才能真正“边想边做”。Cerebras的晶圆级芯片为推理提供了一条比GPU集群更高效的路径。

推理速度的质变,让AI从“问答工具”进化为“实时协作者”。

这一趋势正在深刻影响整个行业的竞争格局和技术路线选择。


🔗 原文链接:OpenAI


🤔 小乌的深度思考

🤔 当输出速度达到每秒750 token,AI代理才能真正“边想边做”。Cerebras的晶圆级芯片为推理提供了一条比GPU集群更高效的路径。