—— 国产开源 Flash 模型以小参数量做到接近重量级模型的能力,背后是算力受限与 AI Agents 需求的共同推动。它们将加速 AI Agents 普及、让私有化部署成为可能,并让个人拥有无限 Token 成为现实。
现象,Flash模型满天飞?
最近一段时间,新的大模型不断的被推出来,特别是以国内为主的开源阵营。大多是一些非常具有性价比的大模型。
比如,glm-5.3-flash,deepseek-v4-flash以及阿里的Qwen3.8-Flash等。它们都具有一些共同的特点,包括
- 模型参数都不算大,相比类似
kimi-k3这种2.8T重量级大模型,这些flash模型的参数分别是320B,285B和185B, 参数少了一个重量级。 - 模型能力却不差。虽然都是flash型参数,但模型的能力却相当强,甚至能比较接近重量级大模型的水准。这种能力,无论是从评分还是实例使用,都得到证实。
- 性价比优势突出。能力水准不错而价格做到极致的低。让这些模型的性价比优势非常突出。
为什么Flash模型发展如此快
我认为有几点因素导致这个现象的出现
AI技术发展的一个必然
AI大模型自几年前开始出现,这几年经过不断发展,算法上等各方面的改良与成熟。模型能力不仅呈现越来越强,对小参数模型,能力也跟随不断发展。特别是一些后训练的训练方式的出现,极大的强化了这一类flash模型的能力。
AI Agents的需求
现在使用AI,早不是单纯依赖AI本身的聊天及思考能力。更多的都是Agents范式下使用AI。
通过将AI与各种工具结合起来,这些工具有Skill,也有Mcp,还有各种本地命令,语言等。结合这些AI工具的支持,AI Agents展现了无穷的能力,类似程序员现在使用的codex也好,claude也是,都是agetns的一种模式。
国内各大企业正的抢占Agent市场,最近火爆的Workbuddy,豆包工作也是agents的一种形式。都是在后面依赖各种工具,来扩充单纯AI的能力。
AI Agents虽然强大,但背后也有另一个需求,就是对Tokens的极大需求。完成一个任务,需要反复的调用各种工具,消耗Tokens。
这种需求下,Flash这种很有性价比的模型才是更需要的。相比大模型,它们的Tokens价格非常低,能力又达到一定的水准。非常适合被AI Agents使用。
国内环境倒逼
稍微仔细观察一下,会发现这一类的模型普遍由国内公司发布,并且都是开源的。
这也是国内环境的一种被逼的结果。
美国对我们中国禁运高端显卡,国内AI企业普遍缺少足够的算力,而重量级参数模型的训练,对算力非常依赖。在这种环境下,倒逼国内AI企业改善算法,一方面在算力不足的前提下训练flash模型,另一方面极致的改良它们的表现。
正是这种环境下,才有可能不断出现各种Flash模型,反观美国,会发现呈现另一种现象。由于根本不缺显卡,它们无论是在Flash模型,还是开源上,都表现的没有国内企业积极。但另一方面,也因此它们在重量极模型及能力上,仍然远远优于国内。ChatGPT或是Cluade模型的能力,一直都是国内模型的努力对标的目标。
会有什么影响?
会极大的扩展AI Agents的普及
其实就行业来论,编程是最早被AI Agents普及的行业之一。
原因很简单,AI Agents在编程上表现地过于优秀及便宜,从出现到流行,再到普及,都短短不到一年左右。现在如果一个程序员,还自己像过去一样手工代码,这种行为已经被称为古法编程。
现在开始,绝大部分代码都已经是AI Agents生成的。codex或是claude code本质上都是AI Agents。
随着deepseek-v4-flash这一类性价比模型的出现及普及,AI Agents的成本也会降低,这意味着未来会有更多人,更多行业,普及AI Agents。
也许现在很多仍然依赖人的工作,未来都会被AI Agents来完成,就如现在程序员编程一样。
私有化部署变得可能及流行
Codex这一类AI Agents工具再好,也面临安全以及成本的问题。
企业内部普及AI Agents的最大的几个痛点无非是 安全以及成本两个。一方面很多企业不太可能也不太愿意依赖云AI来介入企业内部的数据成行为。另一方面这一类云AI的价格和成本也非常高。
但这一类开源的Flash模型的出现,将会解决这两个痛点。它们不仅是开源的,意味着企业可以私有化部署它们,不依赖云AI,另一方面它们的参数不大,能力却很强,好意味都会企业将能够以更低的成本普及AI。
Flash模型将成为未来个人的主力伙伴
不可否认,重量级大参数模型,仍然有着它不可或缺的优势。一些场景仍然需要它。
但对我们个人来说,大部分任务或重复性的,依赖Flash模型便可。就比如编程就我个人的体验来说,大部分编程的需求无非就是增删改查这种级别。Flash模型现在已经能够轻松应付。
虽然在关键的架构及有难度的点上,仍然需要依赖更重量级的模型,但当前,大部分编程工作已经可以交给这种Flash模型。
个人Token会成得到极大的发展
其实,如果你有一台高配置的Mac Studio,或有4090,5090这一类的显卡。你都可以在自己电脑上部署这些Flash模型的一些量化版本。
这意味着你几乎可以无限制的使用Tokens,而不需要担心费用问题。
而且进一步,模型的能力发展并不会就此止步。未来小模型的能力会越发的变强,在这种趋势下,自己就能部署,使用一个完全私有的无限Tokens的情况会越来越变得可能及发展。
总结
要承认的是,我们的生活,我们的工作,已经不可避免的被AI影响与参与。
我们每一个人都在主动或被动的参与AI的时代。不管当前是对我们有利还是不利。参与AI行业的可能获取极大的利润与价值,而被AI吞噬的很多行业的人也面临的失业,收入减少的困境。
个体无法与时代对抗,我们能做的,就是尽量参与到其中,让AI成为我们的伙伴与助手。我们大多数人,无法直接介入到AI行业,去获取这一部分价值与收入。
但让AI成为我们的伙伴,让它成为我们的助手,帮助我们提高我们的效率与产出,是你从现在开始就可以去做的。