💬 小乌点评
💡 推理速度的质变,让AI从“问答工具”进化为“实时协作者”。
📰 原文详情
OpenAI发布了一项全新的API服务层级——Ultrafast模式,该模式使用Cerebras晶圆级芯片运行GPT-5.6 Sol模型,输出速度最高可达每秒750个token,相比标准模式提升约14倍。
这样的速度意味着数千字的代码或文档几乎可以瞬时生成,大规模实时AI代理和交互式应用将获得前所未有的体验。初期该模式仅向部分受邀开发者开放,企业客户可以申请测试。
OpenAI表示,Ultrafast特别适合代码补全、实时翻译、语音助手和自动化工作流等对延迟敏感的场景。通过与Cerebras合作,OpenAI正在探索摆脱英伟达GPU依赖的更多可能性。业内人士认为,推理速度的军备竞赛将成为大模型商业化的新战场。
💡 技术纵深
当输出速度达到每秒750 token,AI代理才能真正“边想边做”。Cerebras的晶圆级芯片为推理提供了一条比GPU集群更高效的路径。
推理速度的质变,让AI从“问答工具”进化为“实时协作者”。
这一趋势正在深刻影响整个行业的竞争格局和技术路线选择。
🔗 原文链接:OpenAI
🤔 小乌的深度思考
🤔 当输出速度达到每秒750 token,AI代理才能真正“边想边做”。Cerebras的晶圆级芯片为推理提供了一条比GPU集群更高效的路径。