笔记本跑 7000 亿参数大模型:SSD 当显存,不用 GPU 也行据量子位报道,GitHub 上最近有个开源项目火了——Colibrì(意大利语,意思就是"蜂鸟"),一个纯 C 实现、不依赖任何推理引擎的框架,已经攒下 3.2 万颗星。它做的事听着有点反常识:让普通笔记本、桌面机,不放显卡也能跑上千亿、甚至上万亿参数的大模型。 内存装不下,那就别全装大模型跑不起来,最常见的理由就是"装不下"。Colibrì 的思路很直白:装不下,那就别全装进去。 这背后靠的是这两年流行的 MoE(混合专家)架构。以它最早支持的 GLM-5.2 为例:整个模型总共 7440 亿参数,但每生成一个字,其实只用到其中一小部分"专家",真正参与计算的大概 400 亿。 于是 Colibrì 把模型拆成两半:每次都要用的那部分(约 170 亿参数,压缩后只占不到 10GB)常驻内存;剩下庞大的专家库(GLM-5.2 有近 2 万个专家,压缩后约 370GB)统统扔进 SSD 固态硬盘。等真正要算到哪个专家,再临时从硬盘里把它捞出来。 作者把这套办法比作"给模型权重做的即时编译"——需要什么,才加载什么。 硬盘、内存、显存"分层住"当然,如果每个字都去硬盘里现翻,速度会慢到没法用。Colibrì 的第二个关键,是把显存、内存、固态硬盘组织成一套分层存储系统,原则是"越常用的专家,住得越近":
设计上有一条很重要的原则:专家放在哪里,只影响速度,不影响模型本身——不管是从显存里读还是从硬盘里读,路线选择和精度完全一样,不会因为你的电脑内存小而偷偷"少算"。 实测速度:慢是慢,但真的能跑据项目测试:作者的开发机只有 12 核 CPU + 25GB 内存,冷启动时只有 0.05~0.1 字/秒,"跑是能跑,就是有点慢";换成 128GB 内存的纯 CPU 桌面机,能到约 1.8 字/秒;如果一路堆到 6 张 RTX 5090,让专家全部常驻高速层,解码速度可以到 5.8~6.8 字/秒。 目前它已支持 9 个模型家族,从 Qwen、DeepSeek V4 Flash(2840 亿),到 GLM-5.2/5.3(7440 亿),最大的是 Kimi K3——2.8 万亿参数,权重约需 1.6TB 硬盘,但内存 32GB 起就能跑,同样不强制要显卡。 想尝鲜也不难:作者提供了 Windows、macOS、Linux 的预编译版本,解压即用;已备好转换过的 GLM-5.2 模型,装好后一条 来源:量子位《笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub》 原文链接:https://www.qbitai.com/2026/09/497624.html 项目地址:https://github.com/JustVugg/colibri |