据量子位报道,由vLLM核心成员创办的创业公司近日公布了一项引人关注的推理性能测试结果:在运行Kimi大模型时,谷歌TPU的推理速度比英伟达GPU快出57%。更值得注意的是,这一测试并非基于谷歌自家的软件栈,而是采用了来自中国的DeepSeek开源推理框架。这一组合打破了以往“英伟达GPU加CUDA生态”几乎是大模型推理唯一优选的固有印象,为行业提供了新的硬件与软件搭配思路。
从技术背景来看,大模型推理长期高度依赖英伟达GPU及其CUDA软件生态,这既带来了成熟的工具链,也形成了较强的路径依赖。谷歌TPU虽然在训练侧早有应用,但在第三方开源模型的推理适配上一直相对封闭。此次测试表明,借助DeepSeek的推理框架,TPU能够高效运行Kimi这类主流开源模型,并在速度上取得明显优势。这背后可能涉及框架对TPU架构的针对性优化,例如对矩阵运算、内存带宽和算子融合的重新调度,从而释放出硬件的潜在算力。
从影响与意义来看,这一结果至少传递出三层信号。第一,大模型推理的硬件选型正在多元化,TPU、GPU乃至其他AI加速器都有机会在特定场景下展现竞争力,企业不必再单一押注某一生态。第二,国产开源推理框架的跨平台适配能力正在增强,DeepSeek框架能够同时支持英伟达GPU和谷歌TPU,说明其抽象层设计具备较好的通用性,这对推动异构算力协同具有积极价值。第三,对于Kimi等国产大模型而言,推理成本的优化直接关系到商业化落地的速度,更快的推理速度意味着更低的单位调用成本和更好的用户体验。
当然,单一测试结果仍需更多独立验证,不同模型规模、批次大小和精度设置都可能影响最终表现。但无论如何,这一案例已经证明,开源推理框架与多元硬件的结合正在成为大模型基础设施演进的重要方向,值得开发者和企业持续关注。
