首页 / 资讯详情
挑战 1 比特!ETH Zürich 秦浩桐:如何把大模型「塞进」小设备?| IJCAI 2026
摘要
面对大模型规模与硬件内存之间高达20倍的算力鸿沟,不重训的“1比特量化”如何把千亿参数的硅基大脑塞进微型设备? 编辑丨岑峰 在 AGI 的狂飙之路上,大语言模型(LLM)正以一种近乎野蛮的“规模法则(Scaling Law)”吞噬着算力与数据。然而,当这些拥有千百亿参数的硅基大脑试图从云端降临到手机、汽车甚至植入式医疗设备时,却撞上了一堵难以逾越的“内存墙”:过去几年,模型参数规模的暴涨速度,惊人地达到了底层硬件内存容量增长速度的 20 倍。在刚刚于德国不莱梅开幕的 IJCAI 2026 大会上,AI科技评论注意到,学术界与工业界正在达成共识:寄希望于摩尔定律或下一代芯片的发布来填平这 20 倍的算力鸿沟,已是痴人说梦。唯一的出路,是向模型的数据表示方式“动刀”。来自苏黎世联邦理工学院Center for Project-Based Learning 的博士后、即将履新香港理工大学的秦浩桐,在首日的“Generalizing from Limited Resources in the Open World”主题 Workshop 中,给出了一个创新解法:挑战无需重新训练的“后训练量化(PTQ)”极限,将庞大的 LLM 强行压缩至极端的 1 比特与 2 比特。作为近年来在模型压缩领域的代表性学者,秦浩桐团队的名字因 BiLLM 与 SqueezeLLM 两项里程碑式的工作而广为人知。在此之前,后训练量化在降至 3 比特以下时,往往伴随着模型智力的“断崖式崩溃”。而秦浩桐团队彻底打破了这一魔咒。他们敏锐地捕捉到了大模型权重深处的“物理规律”:绝大多数权重呈现死寂的“钟形分布”,而真正决定模型生死存亡的“长尾敏感度”,却像遗传基因一样高度集中在极少数的通道中。这场演讲的重大现实意义在于,它向全行业展示了量化技术从“粗暴砍树”向“精准微雕”的范式跃迁。通过 BiLLM,他们不仅摒弃了动辄数十小时的重新训练,仅用半小时单卡算力,就将关键权重单独抽离,把剩余庞大权重极限量化至 1 比特,让原本注定报废的模型依然能连贯对话;而通过 SqueezeLLM,他们进一步确立了以“128 个权重为一组”的动态分配法则,成功把 2 比特量化下困惑度飙升的大模型拉回了工业可用状态。这意味着,大模型在资源受限设备上的普及,终于有了一套突破内存与带宽封锁的“终极压缩算法”。同时,秦浩桐也毫不避讳地指出了极低比特量化驶入深水区后的三大终极挑战:低于 2 比特时复杂逻辑指令的隐性折损、底层硬件对极低比特原生通路的缺失,以及庞大 Activation(激活值)与 KV Cache 的量化坚冰。当全球科技巨头都在为端侧 AI 的入口争得头破血流时,如何越过这最后三座大山,将决定着数百亿美元的端侧大模型市场何时迎来真正的爆发。以下是秦浩桐的演讲实录,AI科技评论做了不改原意的解读:▎演讲标题:Extreme Quantization for Efficient LLMs (面向高效大语言模型的极限量化)01 填平20倍算力鸿沟:量化已非边缘课题首先做个自我介绍。我是秦浩桐,曾在工业界担任研究员,目前即将在香港理工大学(Hong Kong Polytechnic University)担任校长特设助理教授。我的研究长期聚焦于高效深度学习、基础模型压缩,以及探索如何让这些庞然大物在