首页 / 资讯详情
独家解读丨对手买「法拉利」,AMD为何给自己添了一辆「拖拉机」?
摘要
一颗芯片,只为一个模型而生。在模型仍快速迭代的今天,这听起来多少有些反常识。但8月6日,AMD官宣收购加拿大AI推理芯片公司Taalas。待交易完成后,AMD计划将Taalas技术纳入其加速器路线图,并与Instinct GPU共同开发系统级解决方案。某AI芯片企业产品副总裁蒋姚打了个很形象的比方:相比英伟达在有了“大众”后再添一辆追求极致性能的“法拉利”,AMD买下Taalas,更像给自己置办了一辆“拖拉机”。“拖拉机”并非性能差,只是适用范围更窄。那么,Taalas为什么愿意主动舍弃灵活性呢?在Taalas创始人Ljubisa Bajic看来,今天的AI距离真正“无处不在”仍有两个重要障碍——推理成本依然过高,响应速度依然不够快。通用GPU当然也在不断追求更高的推理性能,但“什么模型都能跑”的灵活性,本身也意味着更复杂的存储、互连和软件系统。于是,Taalas干脆一不做二不休,不只针对推理造芯片,而是围绕一个具体模型造芯片,把模型权重和部分数据流直接固化进硬件。牺牲通用性,换来的是更大的硬件简化空间。按照Taalas公布的数据,首款HC1运行Llama 3.1 8B时,单用户生成速度达到约1.7万Token/s。Llama 3.1 8B单用户Token生成速度对比图源:Taalas官网但“拖拉机”有没有价值,最终还得看有没有足够多的“地”等着它去耕。放到Taalas身上,一个更现实的问题是——什么样的模型,已经值得为它单独造一颗芯片?01不是所有业务,都要追着模型更新芯片越是针对某个模型做到极致,它的命运与“这个模型还能被使用多久”就越紧密关联。因此,对于Taalas而言,仅仅证明某个模型“能被硬化”远远不够,选择的模型还必须拥有足够大的持续调用量,才能摊薄芯片定制成本。这样的负载已然出现。DeepSeek V4 Flash上线约10天,仅OpenRouter一个第三方中转平台,累计处理量就达到约8.99万亿Token。OpenAI此前也披露,GPT-5-Codex上线三周内处理超过40万亿Token。不过,更亟待解决的是,在模型仍持续演进的当下,这些理论上的海量Token,还会有多少能继续跑在这颗已经固化的芯片上?这也是Taalas路线所遭受的最直接的质疑,尽管Taalas已同步说明为部分模型调整保留了一定空间。对此,从事模型硬化路线研究的业内人士杨逍指出,讨论模型迭代速度,首先要区分变化的究竟是模型架构、参数,还是不断摸高的前沿能力;对于已经进入业务的模型,则要进一步追问,具体任务是否真的需要随之换代。“解复杂数学题需要最强模型,并不意味着利用AI订会议室、点外卖等自动化服务也必须同步升级到最强模型。”在杨逍看来,一些高频、海量、刚需的服务未必要求最高的智能,更现实的痛点在于贵和慢。据不完全统计,目前公开披露较充分的主流模型,版本的更新并不意味着底层架构每次都会跟着改变,很多时候只是某一维度对更高能力的追求。换句话说,对于一部分任务边界明确的业务而言,只要现有模型已经满足要求,模型新版本增加的智能未必能够产生足够大的新增商业价值,来覆盖迁移和重新验证的成本。此外,硬件固化一个模型,也不意味着这颗芯片只能完成一种任务。杨逍认为,大模型本身已经具备较强的泛化能力,硬件牺牲的是在不同模型之间切换的灵活性,并不等于应用场景也被锁死。但有趣的是,Taalas自身又把问题推向了更难的一面。从其公开点名的Coding和Agent来看,恰恰包括了对前沿模型能力较为敏感的场景。虽然首款芯片选择Llama 3.1 8B这类小模型,但Taalas的野心并不止于