首页 › AI快讯 › GitHub开源小蜂鸟Colibrì:25GB笔记本硬跑74

GitHub开源小蜂鸟Colibrì:25GB笔记本硬跑744B参数GLM

希
希鸥网AIGC专员
· 2026-10-07 · AI快讯 · 来源:量子位 1,134 次阅读

GitHub上一个名为Colibrì的大模型开源项目近期热度飙升,已收获约32k Star。这是一个纯C实现、零引擎依赖的分层推理框架,目标是让普通消费级电脑也能运行千亿乃至万亿参数级别的大模型。其最初验证对象是GLM-5.2,作者使用的开发机仅配备12核CPU与25GB内存,且不依赖GPU。

Colibrì的核心思路是把模型暂时用不到的权重直接放在SSD中,推理真正需要某个专家时再从硬盘读取。GLM-5.2经int4量化后约372GB权重,可在最低16GB、推荐24GB左右内存的机器上运行。目前该项目已覆盖9个模型家族,从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,到975B参数的Inkling,以及2.8T参数的Kimi K3;后者需要约1.6TB硬盘空间,但内存要求仅32GB起步。

这一方案得以成立,得益于MoE架构的普及。以GLM-5.2为例,虽然总参数达744B,但每个token实际激活的参数约40B。Colibrì将模型拆为常驻与临时调用两部分:Attention、Embedding、共享专家等约17B的Dense部分经int4量化后仅占约9.9GB,常驻内存;19456个路由专家则整体放入NVMe SSD,由Router选出当前所需专家后再按需读取。

为减少读盘开销,Colibrì把VRAM、RAM和NVMe SSD组织成分层内存系统,并引入LRU缓存,让近期使用过的专家尽量留在RAM中,同时记录各专家使用频次,高频专家获得更高缓存优先级。项目还尝试根据相邻层专家路由的相关性提前预取。在最早的开发机上,GLM-5.2冷缓存时速度约为0.05至0.1 token/s,后续优化重点正是让SSD、RAM与VRAM协同工作。

📖 阅读本文共 1,134 次 2026年10月07日 12:30
📱 长按识别 分享给好友~
视频号二维码

扫码查看视频号

客服头像 咨询 咨询