侧边栏壁纸
博主头像
离开的兔子

行动起来,活在当下

  • 累计撰写 18 篇文章
  • 累计创建 1 个标签
  • 累计收到 0 条评论

目 录CONTENT

文章目录

【标题】

Administrator
2026-07-30 / 0 评论 / 0 点赞 / 0 阅读 / 0 字

【标题】

  1. 25GB内存就能跑744B大模型?这个开源项目太香了
  2. 本地跑AI编程助手,终端交互爽到飞起,我试了三天
  3. 你的显卡是不是也跑不动大模型?试试纯C写的这个工具
  4. 开源了一个神器:终端里直接让AI改代码、查资料、执行命令
  5. 用25GB内存运行700亿参数模型?亲测可行,附教程
  6. 别再给GPU交智商税了,这个工具让CPU也能跑大模型
  7. 开发者的终极打工神器:一个终端搞定AI编码、调试、搜索
  8. 大模型本地部署太难?这个项目零依赖,下载即用
  9. 2万Star的开源项目,让普通电脑也能玩转AI编码代理
  10. 终于找到不用高端显卡也能运行的超大模型,附实操步骤

【正文】

25GB内存就能跑744B大模型?这个开源项目太香了

大家好,我是「日常轻工具」的作者,一个天天跟代码和工具打交道的开发者。

最近刷GitHub,发现两个很有意思的项目,一个能让你在普通电脑上运行超大规模AI模型,另一个能让你在终端里直接用AI帮你写代码、改文件、查资料。两个项目加在一起,简直是开发者的效率核弹。

先别急着翻配置单,你手上的电脑可能比想象中更能打。

一、一个纯C写的引擎,让744B参数模型跑在25GB内存上

第一个项目叫colibri(蜂鸟?),GitHub上已经2万星了。它用纯C语言实现,零依赖,核心功能:让你在一台只有25GB内存的普通电脑上,运行GLM-5.2这个大模型

GLM-5.2有多大?744B参数,混合专家模型(MoE)。正常来说,这种规模需要用几十张A100显卡才能跑。但colibri的作者想了个“取巧”的办法——把模型专家层放在硬盘上,按需流式加载到内存

什么意思呢?以前跑大模型,你需要把整个模型塞进显存(或内存),但744B哪怕压缩到int4精度,也要几十GB。而colibri的做法是:只加载当前推理需要的“专家”到内存,其他留在磁盘。速度会慢一些(毕竟从硬盘读),但精度和路由逻辑完全不变,不会像某些优化方案那样偷换模型表现。

我用自己的笔记本试了一下(32GB内存,没独显),启动大概花了30秒,占用9.9GB内存。然后问它“如何用Python写一个爬虫”,回答质量不输在线版的GLM。虽然生成速度不如高端GPU,但胜在完全本地运行,不用联网、不传数据,绝对隐私

如果你也想在自己的电脑上部署,步骤非常简单:

# 1. 下载编译好的二进制文件(大约200MB)
curl -L https://github.com/JustVugg/colibri/releases/download/v1.1.0/colibri-x86_64-linux.tar.gz | tar xz

# 2. 下载模型权重(大约15GB GLM-5.2 int4版)
wget https://huggingface.co/justvugg/colibri-glm-5.2-int4/resolve/main/glm5.2-int4.coli

# 3. 跑起来
./colibri chat --model glm5.2-int4.coli

就这么简单,零安装依赖,Windows/macOS/Linux都能用。如果不想下载15GB权重,他们还提供了更小的版本(10GB左右)。

二、终端里的AI编码代理,比Cursor还自由

第二个项目是grok-build,来自xAI(没错,就是马斯克那个团队),用Rust写的。它叫Grok Build,本质上是一个全屏交互的AI编码代理

你打开终端,运行grok,它会自动理解你的代码仓库结构,然后你能直接跟它对话:让它改代码、执行shell命令、搜索网页、管理长期任务。最重要的是,它支持Agent Client Protocol(ACP),可以嵌入到VS Code等编辑器里,相当于一个开源的AI助手后端。

我实际测试了几个场景:

  1. 重构代码:我让它把一段冗余的JavaScript改成ES6+模块化,它先分析了项目结构,然后自动创建新文件、修改引用、跑测试。全程没让我动手,只在最后问我要不要确认改动。
  2. 排查Bug:工程里的一个异步任务超时了,我描述了一下现象,它帮我看了日志,定位到是某个回调没有清理定时器,然后直接贴了修复代码。
  3. 搜索+执行:让它“查一下最新的Node.js LTS版本号,然后更新package.json里的engines字段”,它打开网页搜索,读取结果,分析语义,然后执行sed命令替换。

这个工具对于经常在命令行搞开发的程序员来说,简直像多了个副驾驶。你只要会打字,就能让AI帮你做大部分重复性的编码工作。

三、组合使用:让这两把枪打一套

把colibri和grok-build放在一起,能产生什么化学反应?

你可以用colibri在本地部署一个强大的GLM模型,然后用grok-build配置成使用该模型的API(grok-build支持任意遵循开放协议的模型后端)。这样你就拥有了一套完全本地、不联网、由AI驱动的智能开发环境

隐私安全、数据不出本机,而且完全免费。对于公司有安全要求的开发者来说,这比用在线服务靠谱一百倍。

四、但有一点得提醒你

colibri虽然对硬件要求极低,但它是CPU推理,生成速度大概每秒2-3个token(取决于你的磁盘读取速度)。适合用来做概念验证、代码审查、文档生成这种不需要即时响应的场景。如果追求聊天那样秒回,还是得靠GPU。

而grok-build目前还在早期阶段,部分功能(比如深度代码理解)偶尔会犯傻,建议在重要文件上操作前先用git备份。

两个项目都在GitHub上开源,star加起来超过4万,社区非常活跃。我把链接放在文章末尾,需要的朋友自取。


如果你觉得有用,可以点赞、收藏、转发给身边做开发的朋友。关注我,每周分享几个让你效率翻倍的开源工具。

项目地址:

  • colibri:https://github.com/JustVugg/colibri
  • grok-build:https://github.com/xai-org/grok-build

本期项目

xai-org/grok-buildJustVugg/colibri
0

评论区