扬声·CNDoor.Vip › 首页 ›资讯› 工具速递 › 查看内容

笔记本跑 7000 亿参数大模型:SSD 当显存,不用 GPU 也行

2026-9-28 07:01| 发布者: 糖糊碌| 查看: 48| 评论: 0

摘要: 笔记本跑 7000 亿参数大模型:SSD 当显存,不用 GPU 也行 据量子位报道,GitHub 上最近有个开源项目火了——Colibrì(意大利语,意思就是"蜂鸟"),一个纯 C 实现、不依赖任何推理引擎的框架,已经攒下 3.2 万颗星 ...

SSD 当显存用:笔记本跑 7000 亿参数大模型

笔记本跑 7000 亿参数大模型:SSD 当显存,不用 GPU 也行

据量子位报道,GitHub 上最近有个开源项目火了——Colibrì(意大利语,意思就是"蜂鸟"),一个纯 C 实现、不依赖任何推理引擎的框架,已经攒下 3.2 万颗星。它做的事听着有点反常识:让普通笔记本、桌面机,不放显卡也能跑上千亿、甚至上万亿参数的大模型。

内存装不下,那就别全装

大模型跑不起来,最常见的理由就是"装不下"。Colibrì 的思路很直白:装不下,那就别全装进去。

这背后靠的是这两年流行的 MoE(混合专家)架构。以它最早支持的 GLM-5.2 为例:整个模型总共 7440 亿参数,但每生成一个字,其实只用到其中一小部分"专家",真正参与计算的大概 400 亿。

于是 Colibrì 把模型拆成两半:每次都要用的那部分(约 170 亿参数,压缩后只占不到 10GB)常驻内存;剩下庞大的专家库(GLM-5.2 有近 2 万个专家,压缩后约 370GB)统统扔进 SSD 固态硬盘。等真正要算到哪个专家,再临时从硬盘里把它捞出来。

作者把这套办法比作"给模型权重做的即时编译"——需要什么,才加载什么。

硬盘、内存、显存"分层住"

当然,如果每个字都去硬盘里现翻,速度会慢到没法用。Colibrì 的第二个关键,是把显存、内存、固态硬盘组织成一套分层存储系统,原则是"越常用的专家,住得越近":

  • 最近刚用过的专家,尽量留在内存里,下次再点到就不用重读硬盘;
  • 运行过程中不断统计哪些专家是"常客",给它们更高的缓存优先权;
  • 还能提前一层预测下一层要用哪些专家,准确率约 71.6%,做到一边算一边读,把计算和硬盘读取重叠起来;
  • 如果机器里正好有两块硬盘,还能放一份模型副本分摊读取压力。

设计上有一条很重要的原则:专家放在哪里,只影响速度,不影响模型本身——不管是从显存里读还是从硬盘里读,路线选择和精度完全一样,不会因为你的电脑内存小而偷偷"少算"。

实测速度:慢是慢,但真的能跑

据项目测试:作者的开发机只有 12 核 CPU + 25GB 内存,冷启动时只有 0.05~0.1 字/秒,"跑是能跑,就是有点慢";换成 128GB 内存的纯 CPU 桌面机,能到约 1.8 字/秒;如果一路堆到 6 张 RTX 5090,让专家全部常驻高速层,解码速度可以到 5.8~6.8 字/秒。

目前它已支持 9 个模型家族,从 Qwen、DeepSeek V4 Flash(2840 亿),到 GLM-5.2/5.3(7440 亿),最大的是 Kimi K3——2.8 万亿参数,权重约需 1.6TB 硬盘,但内存 32GB 起就能跑,同样不强制要显卡。

想尝鲜也不难:作者提供了 Windows、macOS、Linux 的预编译版本,解压即用;已备好转换过的 GLM-5.2 模型,装好后一条 coli chat 就能对话,还能打开网页仪表盘,实时看速度、耗时和每个专家当前"住"在哪一层。

来源:量子位《笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub》

原文链接:https://www.qbitai.com/2026/09/497624.html

项目地址:https://github.com/JustVugg/colibri


鲜花

握手

雷人

路过

鸡蛋
扬声 · CNDoor.Vip 汇聚 AI 资讯、办公效率、写作、图鉴等实用内容,为新手提供从入门到上手的 AI 指南。我们相信:AI 不该只是技术圈的事——把复杂的事说人话,让每个人都用得上。
  • 手机博客
  • 手机扬声
Copyright © 2014-2026 扬声 · 菜鸟门 版权所有 All Rights Reserved. 冀ICP备2025120842号
关灯 返回顶部
返回顶部