1 2 3 4 v 1 2 3 4 v

iTxGo🍃 - xBlog

小模型真的开始能干活了

最近看 AI 的消息,我发现一个挺有意思的变化。

前几年大家比的都是谁家模型更大、参数更多、上下文更长。现在却开始有人琢磨另一件事:能不能把 AI 做得足够小,小到普通电脑就能跑。

这事听起来好像没什么,但变化其实挺大。以前用 AI 基本就是打开网页、发给云端、等结果。以后可能变成:我的电脑里就有一个 AI。它不一定比最大的模型聪明,但它可以一直在那儿工作,速度快、不用按次付费,很多数据也不用上传到云端。

更重要的是,这已经不是"未来可能"了。它已经开始发生了。

以前的小模型,是真的不太行

说个我印象挺深的例子。

去年年底,有开发者专门测试本地模型能不能完成一个很简单的"AI 编程 Agent"任务。任务本身不复杂:给 AI 一个代码仓库,让它自己找到需要改的地方,改代码,然后跑测试。

当时的结果很直接——能轻松放在普通笔记本上跑的本地模型,基本都做不到。前沿大模型可以完成,但小模型几乎全部失败。

这其实很正常。让一个 7B、8B 级别的模型自己读代码、调用工具、改文件、检查错误,本来就不是容易的事。

但几个月之后,情况突然变了。

到了 2026 年 4 月,同一个测试里,Gemma 4 26B-A4B 和 Qwen 3.5 35B-A3B 已经能在 10 次测试里成功 9 次。

到了今年 9 月,开发者继续往下测。这次的目标变成了:8B 左右的小模型到底能不能自己写代码?

结果更有意思。Granite 4.2 8B 成功了 8 次,成功率 80%。Ornith 1.5 9B 成功了 6 次,成功率 60%。更小的 4B 模型,目前还是不太行。

也就是说,短短几个月,原本"本地模型完全做不到"的事情,现在已经开始变成:8B 左右的模型已经可以认真干活了。

而且在这项测试里,Granite 4.2 8B 的成绩甚至达到了 GPT-4.1 的水平。

当然,这不意味着一个 8B 模型已经全面超过 GPT-4.1。测试只是一个具体的代码修改任务,实际使用时速度、上下文、工具调用这些问题仍然存在。但它说明了一件很重要的事:模型参数量和实际能力,正在慢慢脱钩。

来源:Simon P. Couch 对本地 Agent Coding 的测试 https://simonpcouch.com/blog/2026-09-02-local-agents-3/

9B 模型已经能帮我操作浏览器了

另一个我觉得更有意思的例子来自微软。

微软今年推出了 Fara 1.5,一组专门用来"操作电脑"的小模型。它不是单纯回答问题,而是让 AI 自己去操作浏览器。比如打开网页、搜信息、填表、比商品、完成网页上的操作。

Fara 1.5 一共有 4B、9B 和 27B 三种规模。其中 9B 模型在 Online-Mind2Web 测试里的任务成功率达到 63%。

更关键的是,它是一个可以公开使用的开放权重模型。微软甚至把模型做到了 MIT License。也就是说,这已经不是"实验室里有个很小的模型",而是"一个普通开发者也可以考虑自己部署的模型"。

这一步挺重要。因为一旦 AI 能自己操作浏览器,小模型就不只是聊天机器人了。它开始有点像一个真正的"电脑助手"。

来源:Microsoft Research https://www.microsoft.com/en-us/research/articles/fara1-5-computer-use-agent/

小模型甚至开始进入 Agent

还有一个变化,我觉得可能更重要。

以前大家觉得 Agent 必须用 GPT、Claude、Gemini 这种顶级模型。因为 Agent 做的事情比较复杂:

理解任务
 ↓
决定下一步
 ↓
调用工具
 ↓
读取结果
 ↓
继续判断
 ↓
修改文件
 ↓
运行测试
 ↓
发现错误
 ↓
重新修改

这东西如果让一个小模型来做,很容易直接跑偏。

但现在已经有人专门研究:怎么让小模型也能当 Agent。

比如今年出现的 EffGen,就是专门针对小模型设计的 Agent 框架。它不是简单地把大模型换成小模型,而是想办法减少小模型需要处理的信息。其中一个做法是压缩上下文,让提示信息减少 70%~80%。

为什么?因为小模型本来就比较容易"迷路"。你一次塞给它几十个工具、几百行代码、几万字上下文,它很容易不知道自己到底该干什么。

所以现在的思路开始变成:不要只想着把模型做大,也可以想办法让任务变简单。

这个思路我觉得挺重要。以前我们总觉得模型不够聪明,那就换更大的。现在开始出现另一种办法:模型不够聪明,那就把任务拆得更合理一点。

这可能也是小模型能真正实用起来的关键。

为什么大家突然开始喜欢小模型

原因其实很现实:贵。

如果一个 AI 产品每天调用几百万次模型,那每次请求省一点钱,最后都会变成很大的数字。而且很多工作根本不需要顶级模型。

比如"这篇文章属于 PHP、Linux 还是 AI"这种问题,没必要动用最强的推理模型。"把这段日志分成正常、警告和错误",也没必要。"判断这条评论是不是广告",同样没必要。

这些事情交给一个小模型,往往就够用了。真正复杂的问题,再交给大模型。

于是以后可能会变成这样:

用户
 ↓
小模型
 ↓
判断问题难不难
 ↓
 ├── 简单 → 小模型直接处理
 │
 └── 复杂 → 大模型处理

这其实就像服务器。你不会因为自己的博客每天只有几千个访问,就买一台几十核服务器。AI 也是一样。该用多大的模型,就用多大的模型。没必要什么事情都上最大的。

更有意思的是,AI 开始往电脑里跑

以前 AI 最大的问题之一是:我的电脑跑不动。一个模型几十 GB、上百 GB,普通电脑根本不用想。

但现在情况正在变化。

O'Reilly 最近的一篇 AI 趋势文章提到,今年越来越多 30B 甚至更小的开放模型已经可以在笔记本或者单张加速卡上运行,而且和顶级模型之间的能力差距正在缩小。

例如最近的 Qwen 3.8 27B,就被认为已经接近一些更大型模型的能力。

NVIDIA 也推出了 Nemotron 3.5 Lightning。它标称总参数量 30B,但实际每次只激活大约 3B 参数。这种设计的目的之一,就是让模型更适合长期运行的 Agent。

Meta 也推出了 30B 的 Muse Glimmer,同样定位于 Agent,而且可以运行在消费级硬件上。

还有一个更夸张的例子。Cactus Compute 的 Needle 2 是一个 45B 模型,但官方介绍它主要针对工具调用、设备操作和结构化数据提取。它宣称运行内存需求可以低到 28MB。

这个数字听起来非常夸张,实际部署能力还要看具体运行环境和模型实现,但它代表了一个很明确的方向:模型正在努力变得越来越容易塞进设备里。

来源:O'Reilly,September 2026 AI Trends https://www.oreilly.com/radar/radar-trends-to-watch-september-2026/

这可能会改变很多软件

假设未来我的电脑里有一个 8B~30B 的模型。它不需要特别强的 GPU,也不需要每次调用互联网。那么很多以前必须依赖云端 AI API 的功能,都可以直接塞进软件里。

比如一个博客。

以前:

博客
 ↓
OpenAI / Claude / Gemini API
 ↓
返回结果

以后完全可以:

博客
 ↓
本地小模型
 ↓
直接返回结果

比如自动生成标题、自动提取标签、自动分类、过滤垃圾评论、搜索文章、整理文章摘要,甚至检查 PHP、JavaScript 有没有明显的问题。这些任务其实都不需要一个超级大模型。

这对个人开发者尤其有吸引力。因为以前做一个 AI 功能,首先想到的是:API Key 从哪里来?每个月要花多少钱?用户数据会不会传出去?API 挂了怎么办?

而本地模型把其中一部分问题直接解决了。

但小模型不会取代大模型

这里也不能把事情想得太美。

小模型现在虽然进步很快,但它距离"全面替代大模型"还差得很远。

让一个 8B 模型写一个简单的 PHP 函数,它可能表现不错。但如果让它阅读一个几十万行的大型项目,然后设计数据库架构,再修改十几个文件,最后解决所有测试错误,那还是大模型更靠谱。

所以我觉得未来更可能不是:

小模型 VS 大模型

而是:

text

小模型 + 大模型

各干各擅长的事情。简单任务让小模型处理,复杂任务交给大模型。大量重复工作交给小模型,真正需要推理的时候,再把问题交给大模型。

我觉得真正值得关注的是"8B 能干什么"

以前我们讨论小模型,喜欢问:"这个模型是多少 B?"7B、8B、14B、32B。

但以后这个问题可能越来越没意思。真正值得问的是:这个模型到底能帮我干什么?

如果一个 8B 模型可以修改代码、调用 Shell、操作浏览器、读取文件、调用 API、分类文本、分析日志,那它就已经非常有用了。哪怕它没有 GPT 那么聪明。

因为它最大的优势不是"什么都会",而是:它可以一直在那里。

我不用考虑 API 费用,不用担心网络,不用把所有东西上传到云端。甚至可以把它塞进一个软件里,让它成为软件的一部分。

AI 可能正在从"网站"变成"基础设施"

我觉得这才是小模型最值得关注的地方。

以前我们说 AI,想到的是 ChatGPT。一个网站,一个聊天窗口。有什么问题,进去问它。

但以后 AI 可能越来越像数据库、Redis、Nginx 一样。它就在我的服务器上,就在我的电脑里,就在我的手机里。软件需要的时候直接调用。

比如:

我的博客
    ↓
本地 AI
    ↓
文章分类

或者:

我的服务器
    ↓
本地 AI
    ↓
分析日志
    ↓
发现异常

甚至:

我的电脑
    ↓
本地 AI Agent
    ↓
浏览器
    ↓
文件
    ↓
终端

到那个时候,我可能不会觉得自己"在使用 AI"。因为 AI 已经变成软件本身的一部分。

最后

所以我现在反而觉得,小模型可能比"又一个超级大模型发布了"更值得普通开发者关注。

大模型当然还会继续变强。但另外一条路线也在快速发展:把原本需要几十 GB、几百 GB 计算资源的能力,慢慢压缩到普通电脑能够承受的范围。

去年可能需要 30B,今年可能 8B 就能做一些事情。再往后,也许 3B、1B 甚至更小的模型,就能完成越来越多的具体任务。

到那个时候,AI 就不再只是几个巨头提供的在线服务。而是每个人的电脑、手机、服务器和软件里面,都可以藏着一个属于自己的 AI。

我觉得这才是"小模型"真正有意思的地方。

AI 不一定要越来越大。它也可以越来越小,越来越便宜,越来越贴近我们手里的设备。

出处: https://xblog.itxgo.com/article.php?id=92
版权:本文采用 CC BY-NC-SA 4.0 协议,完整转载请注明来源。