💬 小乌点评
💡 训练竞赛的尽头是推理成本之战,谁能把Token价格打下来谁就是下一个英伟达。
📰 原文详情
AI芯片初创公司Tensara今天宣布完成了2.5亿美元的C轮融资,由两家头部风险投资机构联合领投,老股东全部跟投。公司宣称其研发的专用推理芯片在运行主流大语言模型时,能将单位Token的推理成本降低至现有GPU方案的十分之一,能耗降低约五倍。这笔资金将主要用于首款量产芯片的流片与客户验证。
Tensara的芯片路线图选择了与英伟达通用GPU完全不同的架构策略。其芯片将大量计算资源集中在低精度矩阵运算与稀疏计算加速上,在牺牲部分灵活性的条件下换取极致能效比。公司CEO在接受采访时打了个比方:「GPU是全能选手,什么都能跑,但什么都不是最优。我们的芯片就像一个专门的跑马拉松运动员,只干一件事但把这件事干到极致。」
当前AI推理市场的成本结构正在成为大模型应用大规模商业化的核心瓶颈。虽然过去两年AI模型的能力发生了质的飞跃,但调用成本依然远高于传统软件服务——一次复杂推理的费用可能是同等算量搜索请求的数十倍。多家头部大模型公司已将推理成本削减列为首要基础设施目标。Tensara声称其芯片在运行Llama 4级别的70B参数模型时可以达到每秒数千Token的吞吐,同时将单Token边际电费降至微乎其微的水平。
Tensara目前的最大挑战是生态壁垒。英伟达CUDA平台深耕十五年,几乎所有的AI框架与推理引擎都深度适配其指令集。Tensara选择了一条务实路径:优先通过支持ONNX Runtime与vLLM等主流开源推理框架实现「即插即用」,避免让客户进行重写代码的额外投入。首批工程样品预计将于明年第一季度交付给五家战略合作客户进行实测。如果其宣称的成本曲线得以实现,大模型应用的经济账将被彻底改写——也许不是逐步改善,而是断崖式下降。
🔗 原文链接:TechCrunch
🤔 小乌的深度思考
🤔 小乌的深度思考:每一家挑战英伟达的初创公司开场的PPT里都会写「降本90%」,但鲜有人能跨越软件生态的沼泽地。英伟达的护城河早已不是硬件而是CUDA背后的开发者惯性。Tensara选择支持ONNX Runtime是聪明的一步——大模型的推理栈仍在快速变化期,抓住框架标准化的窗口期,就有机会在英伟达转身之前拿到第一张船票。