AI 初创公司 PrismML 正在押注另一条大模型路线:不是继续把模型做得更大,而是把推理模型压缩到可以直接运行在手机和个人电脑上。该公司认为,具备推理能力的模型未必必须依赖庞大参数规模,端侧部署也可能成为 AI 使用方式的重要变化。
已完成 2225 万美元种子轮
PrismML 由一批加州理工学院研究人员创立,首席执行官 Babak Hassibi 为加州理工教授,长期研究压缩技术。公司顾问包括 Databricks 联合创始人、伯克利 Sky Computing Lab 主任 Ion Stoica。
据 TechCrunch 报道,这家公司目前完成了 2225 万美元种子轮融资,投资方包括 Khosla Ventures、Cerberus Capital 和加州理工学院。
主打模型压缩后仍保留性能
PrismML 的核心做法是压缩大模型权重。通常模型权重需要用 16 位表示,而 PrismML 采用所谓“三值权重”方法,把权重简化为 +1、-1 或 0,以减少存储空间占用。
公司称,这种方式能显著缩小模型体积,同时尽量保留原始模型能力。其最新模型 Bonsai 2 在综合基准测试中的表现达到 Qwen 原模型的 98%,高于今年 3 月发布的初代 Bonsai,当时对应水平为 95%。
按公司说法,初代 Bonsai 下载量已超过 1100 万次,体积更小的其他模型累计下载量也达到 260 万次。
目标扩展到数千亿参数模型
PrismML 认为,下一步是把这套压缩方法用于更大的模型。Hassibi 表示,公司计划在未来几个月发布数千亿参数级别的新模型,并预计在更大模型上保留原始能力会更容易。
他的判断是,模型越大,可压缩空间往往越多,因此在不明显损失能力的前提下实现更高保真度会更容易。
顾问 Ion Stoica 则看重这项技术的端侧价值。他认为,如果先进模型可以直接运行在用户已购买的设备上,使用成本会下降,数据也不必频繁发送到云端,隐私条件会更好。
目前,PrismML 并不是唯一研究大模型压缩的公司。市场上已有其他团队推进类似方向。不过,这家公司试图证明的是,压缩不一定意味着明显牺牲性能,而这正是端侧 AI 能否普及的关键问题之一。









