8月6日,AMD正式宣布收购加拿大AI推理芯片初创公司Taalas,交易完成后,Taalas的技术将被纳入AMD加速器路线图,并与Instinct GPU协同开发系统级解决方案。这一动作在AI芯片行业引发广泛关注,因为Taalas走的是一条与主流通用GPU截然不同的技术路径——它不为“所有模型”设计芯片,而是为“某一个具体模型”定制硬件,将模型权重和部分数据流直接固化进芯片之中。用业内一位AI芯片企业产品副总裁蒋姚的话说,英伟达是在拥有“大众”之后添置一辆追求极致性能的“法拉利”,而AMD买下Taalas,更像是给自己置办了一台专用“拖拉机”——性能不差,但适用范围更窄。
Taalas创始人Ljubisa Bajic解释,之所以主动舍弃通用灵活性,是因为当前AI推理仍面临两大核心障碍:推理成本过高,响应速度不够快。通用GPU虽然持续提升推理性能,但“什么模型都能跑”的灵活性,本身意味着更复杂的存储、互连和软件系统,这些额外开销最终都会转嫁到成本和延迟上。Taalas的解决方案是围绕单一模型进行芯片定制,通过硬件层面的深度优化,大幅简化系统设计。据Taalas公布的数据,其首款产品HC1在运行Llama 3.1 8B模型时,单用户生成速度达到约1.7万Token/s,这一数字远超通用GPU在同等条件下的表现。
不过,“拖拉机”是否有价值,最终取决于是否有足够多的“田地”等着它去耕。对Taalas而言,最现实的问题是:什么样的模型,已经值得为它单独造一颗芯片?越是针对某个模型做到极致,芯片的命运就越与这个模型的生命周期绑定。如果模型快速迭代,固化在硬件中的权重和架构可能很快过时。但现实中的负载已经给出了答案——DeepSeek V4 Flash上线约10天,仅OpenRouter一个第三方中转平台,累计处理量就达到约8.99万亿Token;OpenAI也披露,GPT-5-Codex上线三周内处理超过40万亿Token。这些海量调用意味着,某些模型已经具备足够的持续使用量,足以摊薄芯片定制成本。
从事模型硬化路线研究的业内人士杨逍指出,讨论模型迭代速度,首先要区分变化的究竟是模型架构、参数,还是不断摸高的前沿能力。对于已经进入业务的模型,要追问具体任务是否真的需要随之换代。解复杂数学题需要最强模型,但利用AI订会议室、点外卖等自动化服务,未必必须同步升级到最强模型。一些高频、海量、刚需的服务未必要求最高的智能,更现实的痛点在于贵和慢。Taalas的定制芯片正是瞄准这一痛点,用牺牲通用性的代价,换取更低的推理成本和更快的响应速度。AMD此次收购,既是对这一技术路线的认可,也为其在推理市场与英伟达竞争增添了新的差异化筹码。
