AI头条 2026-09-20 00:03 · 👁 15 次阅读

从 2.4T 到 284B:模型变小之后,企业 AI 投入的 3 笔账

深圳一支十人规模的 AI 团队,日常工作大部分交给 AI:数百个 Agent 同时运行,分头写代码、做研究。驱动它们的原本是旗舰大模型,但任务一多,旗舰带不动了——

从 2.4T 到 284B:模型变小之后,企业 AI 投入的 3 笔账

深圳一支十人规模的 AI 团队,日常工作大部分交给 AI:数百个 Agent 同时运行,分头写代码、做研究。驱动它们的原本是旗舰大模型,但任务一多,旗舰带不动了——一次只能同时处理两三个任务,进度被拖住

团队试用了多款模型后,换上了 DeepSeek 的轻量版本 V4.1 Flash:任务照常完成,反馈更快,调用费用也更低。用他们的话说,这是眼下“性价比最高”的选择。

这不是个例。今年更早时候,Google CEO 在开发者大会上透露,有些公司到 5 月,全年 Token 预算就已经快用完了——Google 自家的内部 AI 编程工具,每日 Token 消耗从 3 月的 5000 亿涨到 5 月的超过 3 万亿。

一边是任务量暴涨,一边是预算见底。一场从深圳蔓延到硅谷的“换模潮”由此开始:大模型,开始集体变小。对企业来说,这意味着 AI 投入的账本要重新算——至少有三笔账,值得重新过一遍。

3.png第一笔账:参数——从 2.4T 到 284B

今年年中,DeepSeek 发布 V4 Flash 正式版后,有开发者把各款模型的评测成绩和完成任务成本画在同一张图上,提出一个说法:斩杀线——性能不如它、做同样的事却更贵的模型,直接出局。

此后两个多月,多家厂商接连推出轻量版本,参数普遍压到 400B 以下:DeepSeek V4 Flash 为 284B、GLM-5.3-Flash 为 320B、Qwen3.8-Flash-Next 主模型为 125B;而当前旗舰模型以万亿计——Qwen3.8-Max 约 2.4T,Kimi K3 约 2.8T。

小号模型能接住日常,底气来自一个被研究证实了的趋势:2025 年发表于《Nature Machine Intelligence》的一项研究分析了 51 个开源模型,发现在知识、推理、数学和代码几项测试中拿到相近成绩,所需的参数一代比一代少——研究者把这称为“能力密度”的提高。

产品端同样直观。Qwen 公布的同组测试中,27B 参数的 Qwen3.8-27B 在编程测试 SWE-bench Pro 得 61.7 分(上一代同尺寸为 53.5 分);在长程办公测试 CoWorkBench 得 70.7 分(上一代为 61.0 分)。

一位基础模型研究员的观察更直接:约 300B 参数的模型,在他的数据和训练方案下,已经能学进更大模型输出的长推理链。旗舰负责把路探出来,小号跟着把路走宽——旗舰像车队里的那台赛车,不一定量产,但技术会下放

第二笔账:成本——省下的不止是钱

三组数据,能看清这场转向的力度:

其一,海外模型用量统计平台 8 月的周榜单里,V4 Flash 一款模型占全平台实际 Token 用量约三分之一,排在所有模型首位。

其二,第三方评测中,它与国际旗舰的高推理版本得分接近,完成同组任务的成本低约六成。

其三,海外 Agent 平台 Lindy 把大部分日常任务调用从 Claude Sonnet、Gemini 切到 DeepSeek V4 Flash 后,这部分费用下降约九成,产品质量未受影响

类似的迁移还在继续。8 月下旬,匿名模型 Ox-Alpha(后被智谱认领为 GLM-5.3-Flash)进入海外编程平台,一周内在 OpenCode 就有约 50 万人使用;同一测试中,它修好相同问题的输出 Token 只有另一款模型的约三分之一。OpenAI 也把较轻量的 GPT-5.6 Luna 价格下调 80%,海外办公 Agent 公司 Dust 的反馈是:换用 Luna 处理同类任务,速度提高 40%,费用降低 40%。

调用量的迁移同样明显。OpenRouter 数据里,DeepSeek 的 Token 份额从年初的 9% 涨到 6 月初的 18%,增长主要来自 Agent 任务;到 5 月底,V4 Flash 已占 DeepSeek 系列 Agent 任务 Token 用量的 70%。

省钱之外还有快。有研究员举过一个对照:修改一段实验脚本这类任务,用旗舰要等约二十分钟,轻量版本两分钟出结果。既然任务没那么难,等就没必要。OpenAI 首席财务官的一句话点破了行业逻辑:“只要质量够用,低价模型就会被用于更多任务”

第三笔账:运营——任务分层,各干各的

模型厂商已经集体押注“小模型”:7 月底 DeepSeek 发布 V4 Flash 正式版;8 月 26 日,阿里 Qwen 的 Qwen3.8-Flash-Next 与智谱的 GLM-5.3-Flash 同日亮相;9 月 DeepSeek 又推出 V4.1 Flash。月之暗面、腾讯混元也都在推进 Flash 版本。

Agent 从编程走向日常办公之后,选模型的难题换了主体:程序员分得清哪个任务该用贵的模型,普通用户分不清,于是产品开始替用户分。千问办公把任务分成两档——标准模式处理日常办公,高级模式应对难题。按公布数据,标准模式完成单项任务的速度提高约一倍,平均 Token 消耗减少 75%,可覆盖约 95% 的日常任务。腾讯 WorkBuddy 今年 7 月拥有 658.2 万月活跃用户,PC 端用户当月人均使用 19 次;更极端的案例是办公 Agent 创业公司元空智能,已经在用几十亿参数的模型跑垂直任务,通用任务再交给云端混合模型。

这个思路值得记下来:先分清任务,再分派资源——难易分家,账才算得过来

这套“先分类、再分派”的逻辑,放到企业对外的信息建设上同样成立。模型变小的背后,“喂给 AI 的信息质量”越来越值钱——同样的模型,喂高质量、结构化、口径统一的知识,产出才会稳定。成熟的信源建设,会把官网与知识库的初始化搭建(一次性任务)和内容更新、口径维护(日常循环任务)分开管理:前者值得一次投入到位,之后不应随意变动;后者按固定节奏轻量滚动,不需要每次都兴师动众。两类活混在一起做,要么重复浪费,要么疏于打理。

有企业主已经在验证这条路径:上个月一位企业主朋友用 GEO 方法搭建官网,导入企业知识库后客资持续增加,这套实操方法公众号「智扣 AI」免费开放。

结语

模型行业这场“变小”,本质是把资源花在刀刃上:上限继续由旗舰去探,日常交给够用又便宜的小号。企业面对 AI 也是同一道题——分清哪些投入是探上限,哪些是天天都在做的重复运转,然后各按各的节奏。当模型不再是稀缺资源,信息质量与治理方式,才是下一轮竞争的起点。

留一个开放问题:所在团队花在 AI 上的开支里,有多大比例,其实花在了“够用”就能应付的任务上?


相关资讯