页面时间均为北京时间 UTC+8

大模型竞争重心转向效率与分层:OpenRouter数据印证Flash/轻量模型成为真实调用主体

NOW · 立即关注NEW · 新事件日期待核

研究结论 / 核心摘要

2026年9月海内外大模型产业竞争主线已从'能力上限比拼'转向'能力×成本×效率'的综合效率竞争:海外Astra、Claude、Gemini持续抬升复杂任务能力并加快向下沉,国产DeepSeek、Qwen、GLM、MiMo同步推进Flash化与系统协同;OpenRouter日均Token达18.19T,国产模型份额升至61.9%且Flash模型占国产Token 52.4%,印证高性价比模型成为真实调用主体、Frontier模型定位能力上限的产业分工格局。

可信度:高

查看证据 ↓

本次新增变化

暂无单独记录的新增变化;请核对下方证据时间线。

证据摘要

ZSXQ · 2026-09-29 22:41 北京时间 · NEW · 新事件

“# 大模型竞争转向效率与分层,Agent应用加速落地 ——海内外大模型及Consumer / Work Agent产业跟踪 行业研究 · 专题报告 传媒·计算机 投资评级:优于大市(维持) 证券分析师:张衡 证券分析师:熊莉 021-60875160 021-61761067 zhangheng2@guosen.com xiongli@guosen.com.cn .cn S0980517060002 S0980519030002 请务必阅读正文之后的免责声明及其项下所有内容 > 模型能力继续提升,产业竞争重心加速转向效率与分层。海外GPT-6 Astra…”

关联内容单元 #1591 · 原始来源
原始全文
# 大模型竞争转向效率与分层,Agent应用加速落地 ——海内外大模型及Consumer / Work Agent产业跟踪 行业研究 · 专题报告 传媒·计算机 投资评级:优于大市(维持) 证券分析师:张衡 证券分析师:熊莉 021-60875160 021-61761067 zhangheng2@guosen.com xiongli@guosen.com.cn .cn S0980517060002 S0980519030002 请务必阅读正文之后的免责声明及其项下所有内容 > 模型能力继续提升,产业竞争重心加速转向效率与分层。海外GPT-6 Astra、Claude、Gemini等模型持续提升复杂推理、Coding、Computer Use及长程Agent能力,头部厂商同时加快将前沿能力向中端及轻量模型下沉,模型体系逐步形成“旗舰模型定义能力上限、中端模型承接复杂任务、轻量模型覆盖高频调用”的分层结构。Jev等专用决策模型进一步将Agent中的高频决策环节从通用LLM中拆分。国内DeepSeek、Qwen、GLM、MiMo等同样加速Flash化及工程效率优化,并向“模型—推理框架—国产算力”协同演进。模型产业正在从单纯提升能力上限,进入能力、成本、速度和任务效率并重的新阶段。。 单位智能成本下降正在释放真实调用需求,高性价比模型成为Token增长的主要推动力。OpenRouter 2026年9月日均Token已达到18.19T,较年初提升近18倍;调用量增长并未集中于最强Frontier模型,而是明显向高性价比模型迁移。OpenAI平台份额从7月的 $6.0\%$ 回升至9月的 $13.9\%$ ,但9月Luna已经占OpenAI调用量约 $76.3\%$ ,Astra仅占约 $5.4\%$ ,Astra更多承担能力定标和复杂任务,而真正承接规模化Token的仍是低成本模型。国产模型的趋势更加显著,9月平台份额达到 $61.9\%$ ,其中Flash模型已占国产Token约 $52.4\%$ ,DeepSeek V4系列、GLM-5.3-Flash等成为主要调用来源。由此来看,模型价格下降并不一定导致大模型商业价值降低,反而可能通过降低单位成本持续释放需求;随着Agent、Coding及复杂工作流增加单任务调用链长度,Token需求、调用频次和任务复杂度有望共同推动行业增长。 > 应用端开始从“生成内容”进入“执行任务”,Consumer/Commerce Agent率先打通消费场景。Consumer侧以Muse为代表,产品已经能够连接通信、内容、购物、旅行及支付服务,用户只需要提出目标,Agent即可完成任务规划并在后台持续执行;其上线后的下载量和DAU快速增长,初步验证了Consumer Agent的用户需求。更重要的是,Muse正在依托Meta自身的WhatsApp、Instagram、App及硬件入口,并连接Shopify、Walmart、Instacart、Expedia、Stripe、PayPal等外部生态,形成从流量入口—需求理解—商品与服务发现—任务执行—支付交易的闭环。而Sponsored Agents、Mastercard Agent Connect等基础设施的出现,进一步说明Agentic Commerce正在从单一产品探索演进为产业链:AI未来不仅影响用户购买决策,还可能直接参与订单和支付完成,商业模式有望从订阅扩展至广告、交易导流、支付和商业服务。 > Work Agent开始进入企业真实工作流,企业入口、数据和执行能力成为核心竞争要素。以WorkBuddy为例,AI已经从传统Copilot式的“提问—生成内容”升级为“提出目标—拆解任务—调用Skills/Connectors/MCP—多Agent执行—直接交付PPT、Excel、文档和数据结果”的完整工作流。从腾讯既有企业生态来看:微信提供入口和身份体系,腾讯文档、会议、邮箱、乐享及知识库提供企业上下文和数据资产,WorkBuddy与Managed Agents负责执行,腾讯云进一步提供模型、Runtime、算力和安全治理,从而形成“企业入口—数据权限—Agent执行—云基础设施”的完整体系。我们认为,具备用户/企业入口、私有数据、任务执行能力以及商业化闭环能力的平台更有可能将模型能力转化为订阅收入、Agent调用、交易服务和云资源收入;与此同时,Agent渗透带来的推理负载扩张,也有望继续推动模型服务、推理算力及相关基础设施需求增长。 > 风险提示:模型能力提升及Agent渗透不及预期、推理成本下降速度不及预期、应用用户留存及商业化低于预期、行业竞争加剧及数据安全与监管政策变化; # 1. 海内外大模型:能力继续提升,效率与分层成为竞争主线 9月海外头部模型厂商进入新一轮密集发布周期,前沿能力继续提升。OpenAI于9月3日发布GPT-6 Astra,重点提升复杂推理、软件工程、Computer Use及网络安全能力;Anthropic先后推出Fable 5.1/Mythos 5.1及Opus 5.5;Google六周内连续完成三次Flash模型迭代;SpaceXAI亦推出Grok 4.7。模型更新频率继续提升,复杂任务能力仍在快速演进。 竞争的核心变化是Agent能力与运行效率同步提升。Gemini 3.8 Flash重点强化长程Coding与Agent任务,Grok 4.7强化长任务执行及自我校验,Opus 5.5在多数任务接近Fable 5.1能力水平的同时,典型工作负载成本较Opus 5下降约 $40\%$ 。模型竞争已由单一Benchmark扩展至长任务能力、Token效率、运行成本及自主执行能力。 图:能力上限继续抬升,竞争焦点正从“更聪明”扩展至“更长任务、更低成本、更高Agent效率” ## 9/1 ![](images/7c603c2e8847c9f2898b916e248a6c42df9e64050b82658c7800cc864a5cf969.jpg) ## Anthropic Claude Fable 5.1 / Mythos 5.1 ## 安全分层 同底层能力,不同安全档位,面向受信访问场景。 ## 9/2 ![](images/1a2409c37f2efdfdb2a60af14825a9167207c3ccbad95e59b6abc5d51ddaa1f9.jpg) ## Google Gemini 3.8 Flash ## Flash效率 短期内持续迭代,强化Coding与Agent任务效率。 ## 9/3 ![](images/ad84a009eb6c2789fe13a3f945e1b30719f0bf569651155c7a1dcaa21d1ce6be.jpg) ## OpenAI GPT-6 Astra ## Frontier突破 复杂推理、软件工程与网络安全能力显著提升。 ## 9/15 ![](images/0d30c4d24cf3ba3eb65b755e44375a0f9d7b1396bd1cef551b3d6dc072d94ccf.jpg) ![](images/62bd5991724c7321562a739dff84ca9e486ea227826b4ac36dde3d9b79f218e4.jpg) ## 实时Agent 强化实时语音交互与复杂任务执行能力。 ## 9/21 ![](images/0143a12d668b91adcb871123c44e0941685b78795d77b4038251c0fdcea1fb2d.jpg) ## SpaceXAI Grok 4.7 ## 长程任务 强调长任务执行、自我校验与强化学习优化。 ## 9/22 ![](images/efc529c55cca07b32a5db158a5901300123a68f7b10ccf9721eebf639453298f.jpg) ## Anthropic Claude Opus 5.5 ## 降本提效 接近Fable级能力,同时较前代显著优化运行成本。 资料来源:Anthropic Institute、OpenAI,国信证券经济研究所整理 GPT-6 Astra进一步抬升复杂任务能力上限。Astra的提升覆盖复杂推理、软件工程、Computer Use及专业任务等多个维度,OSWorld 2.0得分由GPT-5.6 Sol的 $65.7\%$ 升至 $72.6\%$ ,完成同类Computer Use任务所需时间缩短约 $47\%$ ;AutomationBench由 $18.1\%$ 提升至 $41.4\%$ 。模型能力正在由“回答复杂问题”进一步延伸至端到端执行复杂任务。 Token效率成为Astra本轮升级的重要特征。Artificial Analysis测试显示,Astra Intelligence Index与Claude Fable 5.1并列达到53,但达到同等智能水平的单任务成本约为Fable的40%;Coding Agent能力同样接近Fable,成本约为其60%,主要来自更低的任务Token消耗。Astra体现出前沿模型竞争从单纯提升能力,转向复杂任务能力与单位任务效率同步提升。 图:Astra vs GPT-5.6 Sol ![](images/03d7816a2194b1e99941f3fdbe236df66e5846e4d66271479cbb24651eb38511.jpg) 资料来源:OpenAI,国信证券经济研究所整理 图:相对单任务成本 ![](images/982e47d60bb753142887157afa44ab8844451b27ccd7a5aa81edd11ae564aa60.jpg) 资料来源:artificial analysis,国信证券经济研究所整理 头部厂商正在加快将前沿能力向更低成本模型下沉。Anthropic推出Opus 5.5,在多数任务接近Fable 5.1能力水平的同时,典型工作负载成本较Opus 5下降约 $40\%$ 、输出速度提升 $30\%$ 以上;OpenAI推出GPT-6 Sol和Luna,API价格较上一代同档产品进一步下降。模型厂商已经由单纯依靠旗舰模型刷新能力上限,转向同时提升不同价格带产品的能力与效率。 > 模型产品体系正在形成清晰分层。Frontier模型负责复杂推理、长程任务及能力定标,中端模型承接Agent、Coding等主力复杂任务,Luna、Flash等轻量模型覆盖高频、低成本调用。模型竞争的核心指标由Benchmark进一步扩展至单位任务成本、Token效率、速度和规模化调用能力 图:能力分层+成本效率 Frontier旗舰层 能力上限 ## 主力Agent / Coding层 性价比 / 主力负载 ![](images/7700012eaf01b7552fd88c7bf99e837be71bf4f6aa998c74d220157405e51114.jpg) ## GPT-6 Astra ![](images/e9976c13d78eacc14a5464e86ef38e46105a1c1e440791866777544e3e2d0709.jpg) 高频轻量层 ## Claude Fable 5.1 高频调用 定义前沿能力、复杂推理、长任务执行 ![](images/62dd8211d005c86ac7db3d2fbda8644120c9a725db93fa4144bdbb5d4d82551a.jpg) ## GPT-6 Sol ![](images/498db32ec9d1e2618409d815f67432e00612e4f400ad455083c8df9f7edc5465.jpg) Claude Opus 5.5 以更低成本承接复杂任务与Agent工作负载 ![](images/1fa8faddda0b353381eefe788d992900240bceaf304a5e0ee7e356362455000b.jpg) GPT-6 Luna ![](images/48b2b3ec714a2e803de4d522a43d70ca68f1c57b8dfaee18f06bd4d488fb5493.jpg) Gemini 3.8 Flash 覆盖路由、抽取、日常调用等高频低成本任务 资料来源:Anthropic Institute、OpenAI、Google DeepMind,国信证券经济研究所整理 ![](images/89215d7e3f743e7d36d64188855ddff70fe6eac30438e272db3ac45dbd24ef59.jpg) ## 更高能力 ## 主力负载 ![](images/d8f113366cd8391919fb113b37fdb669d03835df35c0b9f7fd25764821951117.jpg) ![](images/0815a97c1effeec7ce3b615aff6c659f9f4d7255cc580268ecfe7e222590300d.jpg) ## 更高频 / 更低成本 Jev将高频决策任务从通用LLM中进一步拆分。Jev定位System One决策模型,不负责长文本生成,而是根据当前状态及预定义问题直接输出Choice、Score或Yes/No等结构化判断,用于路由、分类、评分及工具选择等高频任务。其端到端延迟约70 - 500ms,输入价格仅0.042美元/百万Token,目标是在低成本和低延迟条件下完成可直接被软件调用的决策。 Jev体现出Agent计算架构由“单一大模型”向功能分层演进。复杂规划、推理和生成仍由LLM承担,高频、低延迟的动作选择和路由判断则可由专用决策模型完成,工具层负责最终执行。Cua已经将Jev作为受约束动作选择器接入Computer Use流程,形成“规划—决策—执行”的分工结构。未来Agent计算有望逐步演化为LLM Planner + Decision Model + Tools的异构体系。 图:Jev:非LLM决策模型 ![](images/41ed29ba2bf033149469f1e9b9124f433bc5381745f9fefa38f25c37b625d056.jpg) 资料来源:Jev,国信证券经济研究所整理 国产模型近期最明显的变化是Flash化及推理效率持续优化。DeepSeek V4.1-Flash通过非对称Causal Encoder-Decoder架构显著降低激活参数及KV Cache占用;Qwen3.8-Flash原生支持1M上下文,重点面向Coding、Agent及高并发场景;GLM-5.3-Flash同样通过低激活参数及稀疏/线性注意力降低推理成本。国产模型竞争正在由参数规模和Benchmark进一步转向低延迟、低成本和规模化推理能力。 旗舰能力与Flash产品同步推进。小米MiMo-V2.6形成Pro、Flash和UltraSpeed三档产品,分别覆盖复杂项目、规模化调用及实时推理。结合DeepSeek、Qwen、GLM近期产品变化,国产模型已经形成“旗舰模型提升能力上限、Flash模型承接规模化调用、工程优化持续降本”的产品体系。 ## 图:四家近期模型变化对比 ![](images/8c58214c1331ca27a7c1ca49b6aefc113bdab33ac9a02bc6948438143f99ca5c.jpg) ## DeepSeek V4.1-Flash ## 关键变化 552B总参,输入8B/输出16B激活 KV Cache显著压缩,原生支持长上下文与视觉 核心方向 架构提效 ![](images/8fb063cdfc0a942b478a97f9330ecdf0751f7070aead1307e4a9f86b6069e0dc.jpg) ## Qwen3.8-Flash ## 关键变化 \- 原生支持1M上下文 \- 重点面向Coding、Agent与高并发调用 ## 核心方向 低成本调用 ![](images/b44c6485ddfd6e502bba054ef2137a1b295f456cc880583755d832538364ada1.jpg) ## GLM-5.3-Flash ## 关键变化 320B总参 / 18B激活 \- 混合稀疏 + 线性注意力,提升推理效率 核心方向 推理效率 ![](images/6fbf5d4cc6859051c646ae31e6b935cb2046473e8dff872cd9ff7378e90697c9.jpg) ## MiMo-V2.6 ## 关键变化 \- Pro / Flash / UltraSpeed三档产品结构 \- 覆盖复杂任务、规模化调用与实时推理 ## 核心方向 能力分层 ## 国产模型正在从‘能力追赶’进入‘能力+成本+工程效率’同步竞争阶段 资料来源:DeepSeek,阿里云,智谱,小米mimo,国信证券经济研究所整理 > 国产模型竞争正在由模型本身向整个推理体系延伸。DeepSeek V4.1-Flash发布后,寒武纪通过vLLM+NeuWare实现Day-0适配;GLM-5.3驱动的Infra Agent在10万卡级国产集群上完成推理系统优化,两周内将端到端吞吐提升至初始基线约3倍;商汤大装置亦开始提供GLM-5.3-Flash国产算力及Token服务。模型、推理框架与国产芯片之间的协同速度明显提升。 > 产业竞争由“能否运行”进一步进入“能否低成本规模化运行”的阶段。模型适配速度、单位Token成本、集群利用率和生产部署效率正在成为国产推理体系的重要竞争指标,国产算力生态开始由可用性验证向经济性验证推进。 图:从“模型能力”进一步延伸至“模型—框架—算力” ![](images/eedcd3c2635fff5ecaea3e50710bfd9a5e1925ce8f4ce02b435a1dad13431ad2.jpg) ## 模型层 大模型能力持续提升并加速开源/落地 ![](images/51c798cac06ba84678a102126cbdfb273d752712e7dbd3233145818ba801f2ee.jpg) ## DeepSeek • V4.1-Flash \- 552B(激活8B/16B) \- 架构提效,推理更高效 ![](images/ab1c3174532b1befc82c8d4ad14fb4a1ab807c2ebf4f05022bd06a57afe89ddc.jpg) ## Qwen \- Qwen3.8-Flash \- 1M上下文 \- 面向Coding / Agent / 高并发 ![](images/f1008878b0e763ced5e33aa19eb4024b42762d0672e226946e92ef127d0e0fba.jpg) ## GLM \- GLM-5.3-Flash \- 320B(激活18B) \- 稀疏+线性注意力 ![](images/07e5383eb4b6b107293a9508fd94c6dcddf63fa870939cd502a0467926c8adcc.jpg) ## MiMo \- MiMo-V2.6 ![](images/7b57adfa9bf3bb5e5c55b82e9457366802ff67de64dd50ab4cf4d86b53048adc.jpg) • Pro / Flash / UltraSpeed \- 面向复杂任务与实时推理模型能力持续追赶 多款模型已实现稳定运行 ![](images/20e8787ab8161fc47a0c9c8e770cb333a3ee55f7664a09f14cadb51afc510e07.jpg) ![](images/4d37c200e87bde886b303147ecf7d776ef9c03f586205d17cce2fe4ec09515a4.jpg) ## 框架与工程层 ## 可运行 推理框架与工程优化 加速适配国产模型 ## NLLM \- 主流推理框架 \- 支持多模型高效部署 ![](images/d72a4b04de21af6bf1f5911765970279b40768c30d11cd8c9482f173018115c6.jpg) ## NeuWare \- 寒武纪自研推理软件栈 \- 实现DeepSeek Day-0适配 ![](images/349ace2561f621f306aa6bfdfeca37bf37dfc52accfbf3936c0b5dcd81cf7ac3.jpg) \- 智谱GLM-5.3驱动 ## Infra Agent \- 10万卡集群推理系统设计与优化 ## 推理优化工具链 \- 算子优化 / 并行策略 \- 畜吐提升 / 延迟降低 ![](images/9fa43d89c5392fe2a9f6264c4c9721f0fc10c2f15f493a75a4d053465d2b57dc.jpg) ## Cambricon ![](images/67527fb3bafbc1e005da461490ffa8fe69fdc57a4b4cd27a19bbe508ef56d1e6.jpg) ## 算力与服务层 ![](images/9baab9e66002b080990710e9757721c497353e5319514d1f7283a1726f2e1f80.jpg) 国产算力与云服务支撑大规模推理寒 武 纪 \- vLLM + NeuWare \- 支现DeepSeek Day-0适配 ## 国产集群 ![](images/5c1b0154a5a64dfbdd073592e16dfb37cfdb824b465900cef9964406948d0af1.jpg) \- 两周内端到端吞吐提升至约3倍 \- 智谱10万卡级集群 ![](images/4d4c0384f7e8db3943db423ec05b506ab9ecc7439a572508dff7c7596a9b4584.jpg) ![](images/3aa0342d9d0349865d9e4783c5ddcdcc052363390aae00d4e3fc61c73f20e7e5.jpg) \- 商汤大装置 \- 为GLM-5.3-Flash提供国产算力与Token服务 ![](images/58c6922ec33077c87106713382d44ad7781f6605ef09e9bfbce79960f95242ae.jpg) ## 可规模化 模型与框架快速适配 大规模集群部署能力提升 ![](images/a4ee51c98cea0864bebaa61e981ca125d4e6b947daa5a70f4878c67f6b60ce4a.jpg) ## 开始验证经济性 单位Token成本下降 集群利用效率提升 从可用性走向经济性验证 ## 国产大模型竞争正在从“模型能力”走向“模型+框架+算力”的系统效率竞争。 资料来源:DeepSeek,阿里云,智谱,小米mimo,国信证券经济研究所整理 海内外模型能力仍在持续提升,但竞争维度已经明显扩展。海外Astra、Claude、Gemini等持续提升复杂推理、Agent、Computer Use及长程任务能力;国内DeepSeek、Qwen、GLM、MiMo则同步推进Flash化、低激活参数、KV Cache压缩及推理工程优化。成本、速度、Token效率和工程可部署性的重要性持续上升 > 模型产品和计算架构同时走向分层。Frontier模型负责复杂推理及能力定标,中端和Flash模型承接大规模真实调用,Jev等专用模型进一步处理高频决策任务,国产体系则叠加模型、框架和算力协同优化。模型产业正在由“模型能力更强”,转向“能够以更低成本、更高效率完成更多真实任务” ## 图:大模型产业正在从“能力竞赛”进入“能力+成本+调用效率”的综合竞争阶段 ![](images/e1266a50dd2ef4c3bf299f272bc9b20288b7c0480050724cd7a5b7af8d79e28a.jpg) ## 能力持续提升海内外前沿模型能力仍在快速进步 ## 海外模型 ![](images/4c1853b86b22b44be578d045cf48dcfef66fb819f2bb43eb8fc0f1a599554da8.jpg) ## GPT-6 Astra Frontier能力进一步提升 复杂推理 / Agent / Computer Use ![](images/e355d644f2b0d9f192f93f0d62d5e1159086d356d2bd068910f0857d801a1f32.jpg) Claude Fable 5.1 多任务能力持续增强 ![](images/d90d171d5cfe8753ff7b408480de57ed28b4a4c6d7577af73eb4fe0df7edbd6c.jpg) ![](images/36ea3f0b9be01cc0410eb2b00fa3e04cfc22083a885c780c6cd6ff6f5fe70ce9.jpg) ![](images/8863f3e2cd4fd7c673ad2ce04f2fa3bfecc59bb9a2909b6e6ec7828145438280.jpg) ## 国产模型 DeepSeek V4.1 552B,8B/16B激活 推迎推理提升 ## Gemini 3.8 ![](images/02ffccd2db453d7cdc87d104e62bd4fb571ae8e914a8cc0c43246b06b45b2a49.jpg) Qwen3.8 1M上下文 Coding/Agent 多模态 / 长上下文工具调用能力提升 GLM-5.3 320B,18B激活稀疏+线性注意力 ![](images/13a0f80c6bc50d6d5fa01717915b357a92cabd86aeae165a746b2bce59873a6b.jpg) ## MiMo-V2.6 Pro / Flash / UltraSpeed 复杂任务与实时推理 复杂推理、Agent、长程任务、多模态能力持续突破 成本显著下降架构创新与工程优化带来推理成本下降 ![](images/7e7be6f12de37c717c647ea270e6407f27a8a4bd26c48105a430f967f1fcc5f5.jpg) ## 典型模型API价格(USD / 百万Tokens) ![](images/53ddd3a52cad6d5d0caae3c109c3c358c4cd6785d78478ef11df224b5511cfb7.jpg) ![](images/79cd355e0c6deb435304d903e1781459dd7ccf0b7ec6b7e18de596d9622bdbda.jpg) ![](images/a444b2bd7259d5a562d17e16865854ea4f8a0813acd1fff6a251103342a67016.jpg) MoE / 低激活参数提升计算效率推理框架优化提升吞吐与速度 ![](images/ccddcaedfc6a6dd3dfb9062a2d9193e9e49740572d05c9c16f2c4f0bbf91471b.jpg) KV Cache压缩降低显存占用 Flash化 降低调用成本 资料来源:Anthropic Institute、OpenAI、Google DeepMind 、DeepSeek、阿里云、智谱、小米mimo ,国信证券经济研究所整理 ![](images/4a86fbb3d40ca8451d6c9c4081ae15de22e5a32586e72e03b70e1d02c2eca0d8.jpg) ## 3 模型产品分层从单一旗舰走向多层级、异构化体系 ## 前沿旗舰模型 定义能力上限 复杂推理/长程Agent/多模态 GPT-6 Astra Claude Fable 5.1 Gemini 3.8 Pro ## 主力模型 (Agent / Coding)承接主要复杂任务能力接近旗舰,成本显著下降 GPT-6 Sol Claude Opus 5.5 MiMo V2.6 Pro ![](images/c3ad31f65d07bbb516df7c06de2ac7bc00306fd4768279f3272e280546b56e73.jpg) 轻量/Flash模型高频调用/规模化应用低成本/高速度 GPT-6 Luna Gemini 3.8 Flash MiMo V2.6 Flash Qwen3.8 Flash ## 专用决策模型 高频决策/低延迟路由/分类/动作选择 Jev (System One) ![](images/7d600cb4a5a09bcbd2cc477d7f0d5ac3129d431854bb9aba044311ef50bc282d.jpg) ## 竞争重心迁移 从“谁更聪明”到“谁能更高效落地” ![](images/e51ccda1059bf984750267f81add08ca782c560587523b88bd4b775d361797cd.jpg) Benchmark竞争模型能力上限的比拼 ![](images/7691389aa557f8e8a3d04b5c2a0f7a564a09b9a7e27c3b07893a2937c091d1a9.jpg) ![](images/ff256e04e994cd81cc1ad5cc8fa0d23b84c32ebe1f69fb5ede21b8c441bb54b3.jpg) ![](images/59ae9add524f696630f54ccffa9c05134213a6a371c5704188ad13ec07f46083.jpg) ## 任务成本竞争 单位任务 / Token成本 ![](images/22e4e0e985fc5df1fee907841be0fa4b0bbd14fb49913b199e3c68a9735c84ce.jpg) ## 调用效率竞争 速度 / 延迟 / 工程可扩展性 ![](images/6beda7c35974861a3d7853175f3c3c8b3b08ec50868e81972e0f04ab707c9c71.jpg) ![](images/52cd7098b4c633e6bc8ce9859dc24c13ca71ed2c840bf3d779906f1a566724e5.jpg) ## 应用增长竞争 真实任务调用量 / 商业化落地 ## 2. OpenRouter观察:调用规模快速扩张,高性价比模型是主要增量 OpenRouter模型调用量在2026年进一步加速。日均Token由1月的1.02T提升至6月6.28T、8月12.24T,截至9月22日进一步达到18.19T,较8月提升 $48.6\%$ ,较年初增长约17.8倍;9月单日峰值达到20.84T。 Token增长同时来自调用频次提升和单任务负载增加。9月前20个有效日累计Token已达到363.7T,相当于8月全月的 $95.9\%$ ;Top应用请求量代理指标9月日均升至约3361万次,较8月增长约 $45\%$ 。真实推理需求仍处于快速扩张阶段。 图:OpenRouter调用规模持续加速 ![](images/caa59898d8ce8a9734362c9e7171e2f52abe14e3e86857843140fa341c3e6e90.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 ![](images/66c75de9527b7958968bbbd17da02c8adfdab3a36a551e0df88e769ebcef439e.jpg) OpenRouter调用结构继续向国产模型迁移。国产模型厂商份额由2026年1月的 $22.5\%$ 提升至7月 $61.5\%$ ,8月短暂回落后,9月再次升至 $61.9\%$ ;同期Google和Anthropic份额分别降至 $5.1\%$ 和 $3.4\%$ 。国产模型已经成为平台主要Token来源。 OpenAI份额自8月以来明显修复。OpenAI平台份额由7月6.0%升至8月10.7%、9月进一步升至13.9%,9月Token量达到50.6T。进一步拆分内部模型结构看,本轮份额回升主要由Luna等高性价比模型放量推动 图:2026年1-9月核心模型厂商调用份额 ![](images/9d0d34472c27990add3f19763470c2eac5b77a38480aa18b0750c71ecdff67e8.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 OpenAI近期Token增长主要由Luna系列承接。Luna占OpenAI内部调用比例由7月10.5%快速升至8月66.6%,9月进一步达到76.3%;同期OpenAI平台份额由6.0%升至13.9%。截至9月22日,Sol占OpenAI调用10.6%,Astra仅占5.4%,高性价比模型是本轮规模化调用增长的主体。 Astra主要承担前沿能力和复杂任务定位。Astra发布后OpenAI整体平台份额有所提升,但Astra自身平台份额仍不足 $1\%$ 。OpenAI当前已经形成较清晰的产品分工:Astra负责能力上限与复杂任务,Luna等模型负责大规模Token调用。 图:OpenAI内部模型结构 ![](images/2a1d266da1bcbc71e992d348b6eaf98065b2501d69d86c3e7813bb297ee8e4b0.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 图:Astra发布前后20日对比 ![](images/dbc60793fef000332c6ea84b502fd56fff8e83cb08b3b23f9e9418811386603e.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 国产模型已成为OpenRouter最主要的调用来源。9月前20个覆盖日国产模型Token达到225T,平台份额升至 $61.9\%$ ,较年初 $22.5\%$ 大幅提升,调用增长已经由阶段性爆款进入较高基数下的持续放量阶段。 ➢ 内部结构由单一模型驱动向多厂商共同增长演变。9月DeepSeek仍位居首位,占国产模型Token约34.9%;GLM占比由8月12.2%升至24.1%,腾讯由18.8%升至23.8%,三者合计达到国产调用约83%。国产模型调用增长正在由早期DeepSeek等单点驱动,向DeepSeek、GLM、腾讯等多厂商共同放量转变。 图:国产模型平台份额 ![](images/66ea606a9b895e3d26d9f40a506190225c1055ec1b9498b988df29056b6f3160.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 图:国产模型内部份额结构 ![](images/9487e47e12f206732535c27b1c80157e7378020e54d3a95d967443188f6ad868.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 国产模型调用增量正在加速向Flash模型集中。国产Flash模型占Token比例由6月23.9%、7月22.7%快速提升至8月41.0%,9月进一步达到52.4%。9月国产模型总Token较8月增加约18.4T,而Flash模型Token增加33.2T,非Flash模型调用有所下降,近期国产Token增量主要由Flash模型贡献。 DeepSeek及GLM Flash系列成为主要负载来源。9月GLM-5.3-Flash占国产模型调用约 $18.0\%$ ,DeepSeek V4 Flash约 $13.7\%$ ,9月10日上线的V4.1-Flash已贡献 $11.5\%$ 。Flash正在由产品补充形态转变为真实推理负载的主要承载形态。 图:国产Flash模型占国产Token比例 ![](images/b7148e731db9f790882ee167de78cc8cf6a6c899511bcfbdb1ab25507ba0ed7a.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 图:9月国产模型Top 5调用结构 ![](images/04d9192b1d4fb4808c9841b4bd252369d032f1c0bc958e4459bba76ba0ce1a78.jpg) 资料来源:OpenRouter,国信证券经济研究所整理 ![](images/5e93ae86eb8b673a8fbc9db3b159b8547ab8b9658d0dc77161e5e31a6ba7c0ff.jpg) ![](images/4a74d9cf24c31b4b7b6ac5672aec2281178b8668de8251819892803ca0325ac1.jpg) 图:从“最强模型”转向“能力×成本×效率” OpenRouter数据验证了模型分层和效率竞争已经进入真实调用环节。9月OpenAI内部Luna占比达到 $76.3\%$ ,Astra仅为 $5.4\%$ ;国产模型平台份额达到 $61.9\%$ ,其中Flash模型占国产Token升至 $52.4\%$ 。大规模Token正在明显向能够以更低成本、更高速度完成任务的模型集中,Frontier模型则主要负责能力定标和高复杂度任务。 > 模型产业的核心指标正在由Benchmark扩展至真实使用效率。不同任务根据所需智能水平进行模型路由,Frontier模型负责高难度任务,高性价比模型负责规模化调用。未来模型竞争将更多体现为能力、单位任务成本、速度及真实调用量的综合效率。OpenRouter以开发者、API及Agent场景为主,其高频数据能够较好反映模型调用结构的边际变化。 ## 1 能力上限持续提升 Frontier模型定义上限,推动整体能力快速递化 ## 2 单位智能成本显著下降 Luna / Flash / MoE等高性价比模型快速发展以更低成本、更高速度提供足够好的能力 ## 3 真实调用向高性价比模型集中 OpenRouter上开发者/Agent的真实Token 更多流向Luna、Flash等高性价比模型 ## 4 支撑Agent规模化调用 ![](images/e1f4f88c56192011649dc5067ffee432a4be1a6f048c37f9ca90a56932e1ae17.jpg) ## OpenAI Astra更强的推理与通用能力 ![](images/0da118bb41f2054c667c04623b5d691589b5270dcd8b2ff2abc64448278f7034.jpg) Anthropic 前沿能力竞争 ![](images/3e45660b4bb36b74e6cab4ac3c79f6c0872cd5389aec15b6874b3aecabf9d764.jpg) ## Google ![](images/1feec372b39e2a35cda0ab1d98c64911353ecdb002d46f80cd1fa460fd915b84.jpg) 多模态与工具能力 ![](images/9ec897c12efc751a16f223012a4ba1cf1776e5a8909360d92252f529e860bf77.jpg) ## Luna 系列 高性价比·规模化放量 OpenAI内部调用76.3% (2026年9月) ![](images/12a2208a4ce4630c10fa686af71d797eb0fc9e32c53b22049bb0d3efae040345.jpg) ## Flash 模型 低成本·高速度 承接大规模推理任务国产Flash占比52.4% (2026年9月) ![](images/2e0c4ec174336052062bfbe9ecbde3e029a34504bb2a97738b96a21053bb5363.jpg) ## MoE / 其他高效模型 更好的性能/成本平衡覆盖多样化场景 ## 前沿旗舰模型 ![](images/dd226cb945b9c634fa298ecad405ce090bb2a1a64845bb48de8c3ed581ab8a46.jpg) (Astra / Claude / Gemini 等) 能力定标·处理复杂任务 较小比例但不可或缺 ## 高性价比模型 (Luna / Flash / 其他) ## 主要调用量持续提升 ![](images/bb3208e5241ed2338f768b6c41df7fbd4cee64c44f6a4ccb6a0161c4ede73cc9.jpg) ![](images/ca7d07c4cb2592018e9619c186fd0b0ee789954ac3d5b5337e4cebbade126370.jpg) ![](images/af58c18baeffb06b31846debf8fc62e974cfbb61e57e24a007d3a908314f5e39.jpg) ![](images/00f235922955100ee3ab221999dc9166fc5fd3dac61e2b671668317182b320b7.jpg) ![](images/7775f93ec431ad8bf21f99a75c9386558019d10da17f6cdc05b895e5fd6251b9.jpg) 更强的模型能力 (定义上限) 资料来源:OpenRouter,国信证券经济研究所整理 ## 更低的成本、更高的效率(高性价比模型发展) ## 更多的真实调用 (Luna / Flash 承接主要Token) “最强模型”定义能力上限,“高效模型”承接主要调用量。 ## 3 Agent应用:从问答走向任务执行,Consumer / Work双线加速落地 AI应用正在由“生成答案”向“执行任务”升级。Consumer / Commerce Agent从信息问答进一步延伸至需求理解、任务执行及交易完成;Work Agent则由办公助手升级为能够连接企业数据、调用工具并直接交付工作成果的生产力平台。应用竞争的重点由单一功能展示转向入口、场景、数据连接及任务执行能力。 ➢ Consumer和Work构成当前Agent落地的两条主要路径。Muse开始打通用户入口、任务执行及交易支付链路;WorkBuddy则进入企业数据、权限和真实工作流。两者共同体现出Agent产品形态由“回答问题”向“完成任务”演进,AI应用价值开始由使用时长进一步延伸至交易规模、工作效率及企业IT支出。 图:Agent应用正沿“Consumer/Commerce”与“Work”两条路径加速落地 ![](images/c9c858a8c1c1f56fc5d8d5e619ceacaa6e5fcf53831f9d58eac84853b37bda31.jpg) Agent应用正沿 Consumer / Commerce 与 Work 两条路径加速落地 资料来源:meta、腾讯,国信证券经济研究所整理 Muse将消费级AI交互由“提问”升级为“交付任务”。Muse能够连接邮件、日历、支付及购物等服务,通过Secure VM浏览网页并在后台持续执行订票、购物、填表、发送邮件等多步骤任务。Connectors进一步扩展第三方服务覆盖范围,使Consumer Agent具备持续扩展真实消费场景的能力。 > 用户增长初步验证Consumer Agent的大众需求。Muse上线12天累计下载约280万次,美国和加拿大iOS下载约180万次;9月19日美国单日下载达到26.4万次,9月18日DAU约44.8万,并一度登顶美国App Store。Consumer Agent开始由技术产品进入大众用户市场。 图:Muse上线后的用户增长 ![](images/ecab8955256275c8448cd3a6ea4aab76b8f3789009be2e23b287acaeba3bb392.jpg) ![](images/1636179f17a5571b4ad965f03775952aa801751cfdfadc2beec2832f6c2786bd.jpg) 图:从Chatbot到Consumer Agent ![](images/9d21dcc90cf763bc655e6f94f55feaf3fa255c2a3546a603c614b401e2ef5fd5.jpg) Consumer Agent开始出现用户规模验证 资料来源:Sensor Tower、Meta、Reuters,国信证券经济研究所整理 帮我订一张去上海的机票 ![](images/462609a1f93ee4278e07ce1d5a2152035830493b5210f4e61e97d274c4534ec5.jpg) ## 以问答为主 需要用户逐步操作 难以跨应用完成复杂任务 资料来源:meta,国信证券经济研究所整理 从‘生成答案’走向‘替用户完成任务’ Meta既有消费入口显著降低Muse的用户触达成本。Muse除独立App外,已经能够通过WhatsApp交互,并连接Instagram内容、AI眼镜和Mac等入口,使社交通信、内容消费、移动端及硬件设备逐步汇聚至同一个Personal Agent。Meta庞大的既有用户和内容生态为Agent提供持续的需求入口和任务触发场景。 外部服务与支付体系正在补齐从需求产生到交易完成的链路。Muse已接入Shopify、Walmart、Best Buy、Instacart等购物服务,并逐步连接Expedia、Notion、GitHub等旅行及工作场景,支付端接入Stripe Link、Shop Pay和PayPal。Muse已经能够沿着需求产生—服务发现—Agent执行—支付交易完成端到端任务,其商业价值有望由订阅进一步延伸至交易导流、支付及商业服务。 图:Muse商业闭环逻辑 ![](images/0a9ad1628ca6eac2f738a240b8163ad8a4c1e0520311e7f3baf70ac220dd6478.jpg) 资料来源:meta,国信证券经济研究所整理 ![](images/70ceb14227b2af4615d57d08a997ee0723b869a64a44842b92f1c96224f37eca.jpg) ![](images/59d012f2e673333c887c7f086ba6d9e1d2245dfdd7543e242f04bcdd61694fa4.jpg) ![](images/2cae496b6cf2c0522c9e84c16816dd0ca8beb7a4cf4564c599ec39df3ef4db24.jpg) Muse正在从流量入口—任务执行—交易支付,逐步形成Consumer Agent商业闭环。 ![](images/7c59841bf076ec23b6399d7c2aa05118355c3fb3b356e007cd0640030efc87a0.jpg) ![](images/b0e83e9767ec9b2ef81f9a02638eed62227ba448e6780d35d29584080074b1b8…
AI 解读

OpenRouter数据首次系统验证'高性价比模型承接主要Token、Frontier模型定义能力上限'的产业分工格局;Jev等专用决策模型开始从通用LLM中拆分高频决策任务,Agent计算架构向LLM Planner + Decision Model + Tools异构体系演进

时间信息

事件发生时间:日期待核 · 日期待核

系统创建:2026-09-29 23:34 北京时间

系统更新:2026-09-29 23:34 北京时间

来源发布时间:见各条证据。

实体 / 行业

实体:Anthropic、Cua、DeepSeek、Expedia、Google DeepMind、Instacart、Jev、Mastercard、Meta、OpenAI、PayPal、Shopify、SpaceXAI、Stripe、Walmart、商汤、寒武纪、小米MiMo、智谱AI、腾讯、阿里云/Qwen

行业:Agent应用、Consumer Commerce/Agentic Commerce、企业级SaaS/办公协作、传媒互联网、国产AI芯片与算力、大模型/基础AI、推理云服务/Inference Cloud

原文与 AI 解读

原文和提取信息可在对应证据条目展开查看。