“# 互联网传媒行业字节AI布局梳理:模型—场景—分发闭环 推荐算法起家,内容生态支撑 AI 落地。字节以推荐算法起家,依托豆包、剪映、抖音等内容生态沉淀的海量视频数据与分发场景,构建起模型—场景—分发的闭环。公司当前已形成 Seed 模型、豆包等应用以及火山方舟企业服务的 AI 布局,并通过内容产品与创作工具提供应用场景。当前字节大模型沿视频内容生产与 Agent 任务执行两条路径商业化:视频链以 Seedance、Seedream 交付可编辑内容资产,Agent 链以 TRAE、扣子交付跨工具任务结果。 视频模型能力向可控创作演进,创作工具与广告场景提…”
关联内容单元 #110 · 原始来源原始全文
# 互联网传媒行业字节AI布局梳理:模型—场景—分发闭环 推荐算法起家,内容生态支撑 AI 落地。字节以推荐算法起家,依托豆包、剪映、抖音等内容生态沉淀的海量视频数据与分发场景,构建起模型—场景—分发的闭环。公司当前已形成 Seed 模型、豆包等应用以及火山方舟企业服务的 AI 布局,并通过内容产品与创作工具提供应用场景。当前字节大模型沿视频内容生产与 Agent 任务执行两条路径商业化:视频链以 Seedance、Seedream 交付可编辑内容资产,Agent 链以 TRAE、扣子交付跨工具任务结果。 视频模型能力向可控创作演进,创作工具与广告场景提供变现渠道。商业视频制作需要在人物、商品和镜头保持一致的前提下反复修改,模型的可控性直接影响素材可用率与返工成本。2026年7月发布的Seedance 2.5支持单次生成30秒视频、最多50个多模态参考素材及指定片段修改,为更复杂的内容制作提供支持。即梦、剪映及CapCut连接生成与编辑需求,8月Seedance 2.5进一步接入TikTok Symphony,向部分市场的付费广告主开放——Seedance既可通过创作工具订阅、生成额度及模型调用收费,也有望通过提高广告素材生产效率扩大既有业务价值。 Agent 切入办公与研发场景,席位订阅与模型服务承接企业需求。Seed2.1 加强了任务规划、工具调用和软件工程能力,TRAE、扣子及火山方舟分别提供任务执行工具、Agent 开发与应用平台、模型服务,企业可按需求采购成品工具或开发自有应用。TRAE 企业版已采用席位与模型额度结合的收费方式,扣子按订阅套餐区分使用权益,为效率改善转化为软件付费提供了路径。视频与 Agent 也开始在具体产品中结合:扣子支持从剧本、分镜到视频生成与剪辑,并可导出剪映工程文件。我们认为,办公、研发和内容制作中的重复任务有望带动持续使用,拓展 Agent 商业化空间。 投资建议。我们认为本轮 AI 产业链的核心驱动来自模型 agentic coding 能力的增强,以 Claude Code、Codex 为代表的编程工具正从辅助补全跃迁至自主协作,并由此向上下游传导出多层投资机会。向上游看,Agentic Workload 对算力的消耗大幅提升,推动云厂商业务高增长,关注 CSP 算力约束缓解与订单增长节奏。向模型厂商自身看,Agentic 任务驱动 Token 消耗飙升、头部模型 ARR 加速提升,短期交易重点在于模型更新、ARR 数据、Token 价格与算力供应等边际变化。向下游应用看,Coding Agent 最先验证 PMF,关注“Claude Code for X”式的场景复制与 Token 经济性提升带来的扩展空间。我们持续看好 AI 发展带来的产业需求加速,建议围绕自研模型+算力+云生态的垂直整合进行标的选择,关注阿里巴巴、腾讯控股;多模态应用场景建议关注快手、美图公司。IP+AI 视频建议关注华策影视、阅文集团、中文在线、上海电影、掌阅科技等;AI 营销关注汇量科技、易点天下、蓝色光标、钛动科技(拟上市)等;AI 陪伴社交关注恺英网络,AI 游戏关注心动公司;AI 内容确权关注阜博集团;AI 医疗关注京东健康、阿里健康。 风险提示。模型与产品竞争风险、边际成本提升风险、数据与内容合规风险。 行业评级 买入 前次评级 买入 ## 相对市场表现  ## 旷实 SAC执证号:S0260517030002 SFC CE No. BNV294 kuangshi@gf.com.cn ## 廖志国 SAC执证号:S0260525060001 liaozhiguo@gf.com.cn ## 章驰 SAC执证号:S0260523080001 gfzhangc@gf.com.cn ## 朱壹 SAC执证号:S0260526080002zhuyi@gf.com.cn 请注意,廖志国,章驰,朱壹并非香港证券及期货事务监察委员会的注册持牌人,不可在香港从事受监管活动。 ## 相关研究 传媒行业:Meta Muse 发布,个人 Agent 开启商业化 2026-09-23 互联网传媒行业:8月国内游戏实际销售收入同环比双增,智谱发布GLM-5.3-2026-09-20FlashX 互联网传媒行业:DeepSeek V4.1 Flash 上线,恺英网络拟间接参投 Wemade 2026-09-13 重点公司估值和财务分析表 股票简称 股票代码 货币 最新 收盘价 最近 报告日期 评级 合理价值 (元/股) EPS(元) PE(x) EV/EBITDA(x) ROE(%) 2026E 2027E 2026E 2027E 2026E 2027E 2026E 2027E 横店影视 603103.SH CNY 16.01 2025/10/24 买入 18.18 0.52 0.63 31.58 26.06 10.70 9.00 20.5 19.9 芒果超媒 300413.SZ CNY 19.00 2026/8/23 买入 22.77 0.46 0.70 39.30 25.83 3.90 3.30 3.5 5.0 儒意电影 002739.SZ CNY 8.35 2025/10/31 买入 14.20 0.47 0.60 18.34 14.37 6.10 5.20 11.5 12.7 新媒股份 300770.SZ CNY 35.22 2026/8/31 买入 43.63 2.91 2.97 11.87 11.63 7.90 7.60 18.4 18.6 世纪华通 002602.SZ CNY 14.23 2026/8/30 买入 19.64 1.23 1.49 11.94 9.86 7.20 5.70 24.2 26.3 巨人网络 002558.SZ CNY 23.62 2026/8/30 买入 37.87 2.37 2.70 10.54 9.25 9.20 7.50 26.8 27.9 完美世界 002624.SZ CNY 9.69 2026/8/21 买入 13.33 0.67 0.96 14.88 10.39 10.40 6.80 15.5 19.1 神州泰岳 300002.SZ CNY 7.98 2025/11/1 买入 17.09 0.74 0.83 10.74 9.58 11.60 9.60 15.7 15.5 吉比特 603444.SH CNY 342.00 2026/8/14 买入 474.82 27.93 30.54 12.45 11.39 7.80 6.60 33.4 33.5 三七互娱 002555.SZ CNY 17.38 2026/8/27 买入 21.62 1.35 1.53 13.03 11.50 12.30 9.20 19.8 20.2 恺英网络 002517.SZ CNY 16.17 2026/9/14 买入 23.49 1.30 1.44 12.78 11.53 10.60 7.90 26.5 26.8 分众传媒 002027.SZ CNY 4.66 2026/8/19 买入 7.91 0.40 0.38 11.65 12.26 7.30 7.00 38.8 37.0 天下秀 600556.SH CNY 4.54 2026/4/10 买入 7.23 0.05 0.08 92.80 58.00 44.60 36.70 2.1 3.4 中南传媒 601098.SH CNY 10.18 2026/8/26 买入 13.38 0.89 0.93 11.55 11.05 2.40 1.40 9.0 8.6 凤凰传媒 601928.SH CNY 8.26 2026/8/27 买入 9.94 0.55 0.62 15.00 13.31 11.10 10.10 7.0 7.7 皖新传媒 601801.SH CNY 5.53 2026/4/29 买入 6.67 0.37 0.39 14.43 13.69 3.80 3.40 5.9 6.2 蓝色光标 300058.SZ CNY 13.15 2025/10/30 买入 8.84 0.09 0.11 146.11 119.55 30.00 26.90 3.6 4.2 华立科技 301011.SZ CNY 15.96 2026/4/15 买入 25.64 0.57 0.77 27.37 20.26 14.20 12.10 8.6 10.8 浙数文化 600633.SH CNY 10.13 2026/8/16 买入 15.59 0.52 0.57 19.77 18.04 14.30 13.10 6.2 6.5 易点天下 301171.SZ CNY 33.51 2026/3/26 买入 48.80 0.53 0.71 65.09 48.59 70.00 50.50 6.3 7.7 腾讯控股 00700.HK HKD 436.60 2026/8/13 买入 667.51 29.50 30.49 12.22 11.83 12.70 11.90 20.6 20.1 美团-W 03690.HK HKD 71.65 2026/8/30 买入 119.52 0.79 2.70 79.74 23.33 43.90 15.60 3.2 10.4 泡泡玛特 09992.HK HKD 152.10 2026/8/23 买入 186.91 8.05 9.86 16.58 13.54 13.50 11.20 51.4 59.7 哔哩哔哩 BILI.O USD 14.90 2026/8/28 买入 24.71 1.08 1.31 13.84 11.36 9.00 8.00 11.0 13.0 哔哩哔哩-W 09626.HK HKD 116.50 2026/8/28 买入 193.71 8.45 10.29 13.83 11.35 9.00 8.00 11.0 13.0 网易 NTES.O USD 115.41 2026/8/23 买入 141.26 1.81 2.11 12.81 11.03 10.80 9.20 21.1 21.1 网易 09999.HK HKD 180.90 2026/8/23 买入 221.59 2.85 3.30 12.90 11.11 10.80 9.20 21.1 21.1 腾讯音乐 TME.N USD 8.40 2026/8/12 买入 13.35 0.94 1.04 8.25 7.46 1.07 0.98 11.0 11.0 腾讯音乐-SW 01698.HK HKD 32.38 2026/8/12 买入 52.36 3.69 4.08 8.43 7.63 1.07 0.98 11.0 11.0 阿里巴巴 BABA.N USD 109.76 2026/8/23 买入 175.57 7.18 10.40 15.52 10.71 15.89 11.44 11.4 10.1 阿里巴巴-W 09988.HK HKD 108.40 2026/8/23 买入 180.96 7.04 10.20 15.52 10.71 15.89 11.44 11.4 10.1 京东 JD.O USD 26.51 2026/8/15 买入 35.66 1.55 2.13 17.39 12.67 4.05 2.82 10.0 15.5 京东集团-SW 09618.HK HKD 103.70 2026/8/15 买入 149.71 6.07 8.34 17.29 12.59 4.05 2.82 10.0 15.5 微博 WB.O USD 6.49 2026/8/20 买入 11.62 1.50 1.70 4.36 3.85 3.90 3.10 4.8 6.5 微博-SW 09898.HK HKD 50.85 2026/8/20 买入 91.14 10.20 11.77 5.05 4.38 3.90 3.10 4.8 6.5 百度 BIDU.O USD 87.33 2026/8/19 买入 167.00 6.52 7.41 13.80 12.14 3.00 3.00 4.0 4.0 百度集团-W 09888.HK HKD 85.30 2026/8/19 买入 163.00 6.39 7.26 13.64 12.01 3.00 3.00 4.0 4.0 数据来源:Wind、广发证券发展研究中心 备注:表中估值指标按照最新收盘价计算,哔哩哔哩、网易、腾讯音乐、阿里巴巴、京东集团、微博、百度集团的 EPS 单位为美元/ADS,哔哩哔哩-W、网易-S、腾讯音乐-SW、阿里巴巴-W、京东集团-SW、微博-SW、百度集团-SW 的 EPS 单位为港元/股。 ## 目录索引 一、历史沿革:从推荐算法到大模型,内容积累支撑 AI 布局 …… 5 二、核心人物:梁汝波定调,模型/产品/工具三线推进 …… 6 三、模型迭代:多模态与 Agent 能力持续完善 …… 7 (一)通用模型迭代 …… 7 (二)图像与视频模型迭代 …… 9 (三)语音模型迭代 …… 12 四、商业化路径:视频链形成内容资产,Agent 链推进任务交付 …… 13 (一)视频链:从生成内容资产到商业转化 …… 13 (二)AGENT 链:复杂任务和多模态能力进入竞争前沿,产品体系覆盖模型至企业部署 …… 14 (三)关键经营指标 …… 16 五、投资建议 …… 19 六、风险提示 …… 20 (一)模型与产品竞争风险 …… 20 (二)边际成本提升风险 …… 20 (三)数据与内容合规风险 …… 20 ## 图表索引 图1:大模型业务历史沿革....6 图2:字节大模型业务核心人员架构....6 图3:Seed 2.1基准测试评分....9 图4:Seedance Arena排名....11 图5:Seedance 2.5绿幕编辑能力演示....11 图6:字节跳动大模型业务商业化路径....13 图7:字节在视频生成、编辑、分发和交易环节均可回收价值....14 图8:字节Agent变现方式由模型调用向席位、平台资源和企业部署扩展....15 图9:TRAE办公助理使用场景演示....15 图10:移动端豆包MAU(万人)....16 图11:主要AI原生应用月活(亿人)....17 图12:豆包大模型日均Token使用量快速增长....17 图13:火山引擎在中国公有云模型调用量中的份额....18 表1:字节通用大模型迭代....8 表2:字节图像生成与编辑、视频与音视频生成大模型迭代....10 表3:字节语音与音频大模型迭代....12 表4:字节跳动当前模型矩阵....12 表5:Seed 2.1 Pro Agent细分能力测试结果....15 ## 一、历史沿革:从推荐算法到大模型,内容积累支撑 AI 布局 字节的 AI 能力积累始于推荐算法,并随内容业务发展逐步延伸至多模态研究。2012 年今日头条上线,公司以机器学习驱动内容推荐,此后抖音、西瓜视频进一步扩大了推荐系统的应用范围。内容产品的长期运营使公司积累了用户交互分析、视频理解和低延迟高并发服务的工程经验,自然语言处理、计算机视觉、语音合成和音乐生成等研究也逐步用于旗下产品。我们认为,这一阶段的积累使公司同时拥有内容创作需求、产品试验场景及分发渠道,为视频模型研发与商业应用提供了较好的条件。 2023 年,字节开始形成基础模型、消费应用与企业服务并行发展的业务布局。Seed 团队成立,承担基础模型研发;豆包(早期名称为“云雀”)作为面向个人用户的交互产品推出;火山方舟则成为面向企业和开发者的大模型服务入口。 2024 年,字节将模型能力与开发平台集中对外发布。5 月,豆包模型家族、火山方舟 2.0、扣子专业版及 AI 云基础设施上线,开始形成从模型调用、Agent 开发到企业应用的产品供给;9 月,视频、音乐、同声传译等多模态能力进一步纳入模型。豆包大模型的日均 Token 调用量从 5 月的 1200 亿增至 9 月的 1.3 万亿以上,背后反映“低价—规模—反馈—再降价”的正循环:字节大模型采用低单价扩大调用,大调用量提供真实反馈与摊薄成本,进而支持继续降价和优化。 2025 年,模型供给由通用对话向多模态与任务执行扩展。通用模型先后迭代至 Seed1.5、1.6 和 1.8 版本,图像、视频、视觉理解、3D 与 AI4S 等方向同步推进。TRAE 和扣子进一步将模型用于代码开发与应用构建,Seed Edge 及开源项目则支持长期研究和开发者生态。随着模型能力逐步分化,公司围绕不同产品需求组合文本推理、视觉理解、内容生产和工具调用能力,模型研发与产品开发之间的分工也更加明确。 2026 年,字节继续强化复杂任务处理、可控内容生成与实时交互能力。2 至 4 月,Seed2.0 面向复杂任务和大规模部署推出,Seedance2.0 将文本、图像、视频和音频统一纳入音视频联合生成框架,Seeduplex 与 Seed 3D 2.0 进一步补充实时语音和 3D 能力。6 月,字节在火山引擎 FORCE 原动力大会期间公布 Seed2.1、Seedream5.0Pro 和 Seedance2.5。其中,Seedance2.5 将单次原生视频生成时长提升至 30 秒,并将可参考素材数量扩展至 50 个,进一步强化可编辑输出和连续内容生产能力。 图 1:大模型业务历史沿革  数据来源:字节跳动Seed官网、火山引擎官网、TRAE官网及官方社区、TikTok for Business官网、界面新闻、品玩、智东西、Social Media Today、广发证券发展研究中心 ## 二、核心人物:梁汝波定调,模型/产品/工具三线推进 公司 AI 业务由 CEO 梁汝波直接定调,围绕模型研发、应用产品、开发工具和企业服务形成分工。其中,Seed 负责基础模型研发,Spring 覆盖 Flow、Ocean 等团队,推进豆包应用与 AI 硬件;Stone 承担产品研发支持和开发者工具业务,火山引擎面向企业提供模型与云服务。即梦、剪映等创作产品则将图像和视频模型用于内容生产,连接字节已有的创作者与商业客户。 图 2:字节大模型业务核心人员架构  数据来源:晚点LatePost、科创板日报、大河财立方、第一财经、雷峰网、InfoQ、每日经济新闻、TRAE官网、扣子官网、火山引擎官网、广发证券发展研究中心 Seed 由吴永辉负责,承担基础模型研究及面向产品的模型能力开发。据第一财经、雷锋网、InfoQ 与晚点 LatePost 信息,吴永辉于 2025 年加入字节,此前担任 Google DeepMind 研究副总裁,具有机器学习研究与大规模模型研发管理经验。Seed 的工作覆盖语言、视觉、语音及多模态方向,下设预训练数据、Horizon RL、办公产品后训练和对话产品后训练四个一级部门,旨在将基础能力用于对话、办公及代码等任务。 其中,(1)预训练部门由李成刚负责,为多模态与大语言模型提供训练数据,其中文本、代码和视觉方向的重要成员包括沈科和林毅等;(2)Horizon RL 由唐晟宇负责,集中推进强化学习,其中岳宇、王明轩和吴侑彬分别承担 RL Scaling、推理和视觉强化学习工作;(3)产品后训练分为办公与对话两个方向,其中办公后训练由秦禹嘉负责,面向办公和 Agent 任务,承担模型整合、发布及任务优化;对话方向由朱文佳负责,面向豆包、Dola 等对话产品。 此外,多模态交互与世界模型由周畅负责,覆盖视觉生成(Seedream、Seedance)及机器人(Seed Robotics)相关研究。语音和音频方向的重要人员包括王雨轩和陈卓,研究方向为实时语音交互与音频内容生成。基础设施与学术合作为模型研发提供系统和研究支持。项亮负责豆包大模型基础设施相关工作,其团队服务于大规模模型训练与推理,曾从事推荐系统研发,具备机器学习系统建设经验;李航以顾问身份参与学术合作,推动研究团队与外部学术资源的联系。 Spring 产品部门由朱骏负责,重点推进 AI 应用与交互产品。据晚点 LatePost、科创板日报及每经网信息,朱骏是 Musical.ly 联合创始人,曾任 TikTok 产品负责人,具有消费产品研发和用户增长经验。Flow 主要推进以豆包为代表的 AI 应用产品开发,该体系下,赵棋负责豆包产品,统筹移动端、PC 端和模型策略产品。Ocean 负责 AI 硬件与终端合作,由刘成城负责,其曾创办 36 氪,后随收购加入字节。团队围绕手机、耳机等终端探索豆包的使用方式,工作涉及硬件产品规划、软硬件体验及厂商合作。 Stone 由技术副总裁洪定坤负责,围绕 AI 产品研发和开发者工具开展工作。据晚点 LatePost、TRAE 官网、扣子官网信息,Stone 承接产品后端研发支持,扣子与 TRAE 是其重要产品,其中扣子支持通过知识库、插件和工作流构建应用,TRAE 将代码理解、工具调用与任务执行引入研发流程。 火山引擎由谭待负责,推进模型和云服务的商业化。火山方舟为企业与开发者提供模型服务,市场、销售及客户服务由创造力服务平台统筹。据每经网、火山引擎官网及品玩网信息,该平台整合火山引擎与飞书 GTM 团队,谭待担任负责人,飞书销售负责人林婵,及战略与市场负责人史志隽向其汇报。其工作覆盖 MaaS 和 SaaS 客户需求,将模型调用、云基础设施及办公应用纳入企业服务,支持客户从产品试用走向采购和部署。 ## 三、模型迭代:多模态与 Agent 能力持续完善 字节模型体系沿两条主线持续迭代:一是由通用语言模型扩展至图像、视频、语音和音频等多模态模型,二是由内容理解与生成进一步延伸至工具调用、Coding 和 Agent 任务执行。豆包提供消费交互入口,即梦与剪映提供内容创作与编辑场景,TRAE 面向软件工程,火山方舟面向企业服务,使模型研发能够持续获得实际产品和任务反馈。 ## (一)通用模型迭代 通用模型的迭代重点是推动模型由发展基础对话能力向复杂任务执行底座演进。2024年推出的豆包模型家族通过Pro、Lite等不同档位覆盖通用生成及部分垂类能力;Doubao1.5Pro随后强化文本、视觉和语音的协同处理,ThinkingPro版本进一步提升多步推理及搜索能力。Seed1.6通过长上下文和动态推理机制增强长文档、复杂代码及多轮任务处理,Seed1.8则将能力边界由回答问题推进至工具调用和复杂工作流执行。进入2026年,Seed2.0 进一步强化多模态理解、长链推理、Coding 和跨工具 Agent 能力,并通过 Pro、Lite、Mini 三档,以及 Code 等型号覆盖复杂任务、规模化部署、低时延调用和软件工程场景;Seed2.1 分为 Pro、Turbo 层级,进一步优化图像、复杂信息图、空间关系和长视频的理解能力。模型评价重点也由单项测试逐步转向办公、研究和代码工程等任务的端到端交付。 表 1: 字节通用大模型迭代 时间 模型/系列 具体能力 参数 2024-05 豆包模型家族 通用模型分Pro、Lite档,并覆盖FunctionCall、向量化、语音、图像等垂类模型 / 2025-01 Doubao1.5Pro 文本、视觉、语音多模态能力都有全面技术提升。语音多模态上提出新的Speech-to-Speech端到端框架。 使用稀疏MoE架构,激活参数约为同等稠密模型的1/7;视觉编码器DoubaoViT为2.4B 2025-04 Doubao1.5Thin kingpro 重点提升需要多步推演的任务能力,多模态版本可将图像、菜单、图表和文档内容纳入推理过程,训练了“边想边搜”能力 MoE架构:总参数200B,激活参数20B 2025-05 Seed-1.5-VL 模型不仅能够完成OCR、图表问答、目标定位和空间关系判断,还可以将视觉理解结果用于GUI操作、游戏环境决策和视频内容推理 视觉编码器532M+MoELLM激活参数20B 2025-06 Seed-1.6 模型支持256K长上下文,可用于长报告、复杂代码和多轮任务状态的持续处理;FullCoT、NoCoT与AdaCoT三种模式则分别对应完整思维链、直接回答和按任务难度自动分配推理预算。 总参数230B,激活参数23B 2025-12 Seed-1.8 将通用模型的定位从“回答问题”推进到“执行复杂工作流”。支持文本和图像输入以及视频理解。 / 2026-02 Seed-2.0 重点增强多模态理解、复杂指令执行、长链推理、工具调用和代码工程能力。Pro、Lite和Mini分别面向高难度复杂任务、效果与成本平衡以及低延迟低成本场景,Code型号则专门服务于需求理解、代码生成、调试和工程交付。 / 2026-06 Seed-2.1 进一步将基础模型能力收敛到办公、研究和软件工程等高经济价值生产力场景,继续提升图像、复杂信息图、空间关系和长视频的理解能力。 / 数据来源:火山引擎官网、字节跳动Seed官网及技术报告、广发证券发展研究中心 图 3: Seed 2.1 基准测试评分 Benchmark Seed2.1 Pro Seed2.1 Turbo Claude Opus 4.7 GPT-5.5 Gemini 3.1 Pro Workspace Bench 53.0 54.7 55.1 58.7 32.8 PresentBench 54.6 48.3 61.8 68.9 52.1 Agent Startup Bench 68.8 54.0 62.3 68.1 45.7 Agents' Last Exam 19.5 / 41.4 - 18.4 / 40.5 24.0 / 42.8 15.8 / 32.0 OneMillion Bench 68.8 66.6 73.0 69.6 60.2 OfficeQA Pro 70.9 62.8 76.5 62.9 72.5 GDPval 87.9 82.7 82.7 84.9 67.3 Finance Agent v1.1 60.7 56.0 64.4 65.3 59.7 APEX Agents 33.8 29.2 33.9 35.4 33.5 数据来源:字节跳动Seed官网、广发证券发展研究中心 ## (二)图像与视频模型迭代 图像模型的迭代主要围绕提高中文内容生成的实际可用性,并逐步打通生成与编辑环节。Seedream2.0首先针对中文语义理解、双语文字渲染和中国文化内容生成等薄弱环节进行优化,使模型能够更好地服务海报、营销素材和信息图等含文字场景;Seedream3.0进一步改善复杂提示词遵循、画面结构、视觉质量和推理速度。SeedEdit3.0则将能力延伸至局部修改、主体保持和背景替换等编辑任务,降低编辑过程中无关区域被改变的概率。此后,Seedream4.0及后续版本逐步将图像生成、图像编辑、多参考图输入和连续创作整合至统一框架,使模型由执行明确提示词,转向结合世界知识、参考图片和用户意图进行可控创作,应用范围也由普通文生图拓展至品牌视觉、信息图、专业摄影及后续可编辑工作流。 视频模型的迭代方向由单镜头画面生成逐步转向具备多镜头叙事、原生声音和连续修改能力的音视频创作。PixelDance 和 Seaweed 阶段重点解决复杂动作、镜头运动、主体结构稳定及连续画面一致性问题;Seedance1.0 进一步统一文生视频与图生视频,并强化多镜头切换、提示词遵循和主体一致性。 Seedance1.5Pro 将模型能力由纯视频生成推进至原生音视频联合生成,使人声、环境音和配乐能够与画面动作、口型及叙事节奏同步。Seedance2.0 进一步统一文本、图片、视频和音频输入,支持素材引用、视频延展、局部修改和多镜头输出。最新公布的 Seedance2.5 则继续延长单次生成时长、扩大参考素材规模并强化可编辑输出,使模型由生成若干短镜头,进一步转向承载较完整叙事和反复修改的内容生产工具。 表 2:字节图像生成与编辑、视频与音视频生成大模型迭代 时间 模型/系列 具体能力 图像 2025-03 Seedream2.0 Seedream2.0重点解决中文语境理解、中文文字渲染和中国文化内容生成等早期文生图模型的薄弱环节。模型同时支持中文和英文提示词,并能够在图像中生成双语文字,提升海报、营销素材和信息图等含文字内容的可用性。其训练和后处理流程还覆盖不同分辨率与宽高比,使模型能够适配更丰富的内容创作版式。 2025-04 Seedream3.0 Seedream3.0在Seedream2.0基础上系统提升复杂提示词对齐、中文文字渲染、视觉美感和图像保真度,并将原生输出分辨率提高至2K。模型能够更准确地处理包含多主体、空间关系、文字排版和细节约束的生成需求,降低提示词被遗漏或画面结构失真的概率。其通过一致噪声期望和重要性时间步采样等方法实现4至8倍推理加速,1K图像可在约3秒内生成。 2025-06 SeedEdit3.0 SeedEdit3.0是与Seedream3.0配套的专业图像编辑模型,重点解决“该改的地方没有改”和“不该改的区域被破坏”两类问题。模型能够执行人像修饰、背景替换、物体增删、视角变化、光影调整和文字修改,并在编辑过程中尽可能保持主体身份、背景结构和未编辑区域细节。其支持4K图像处理和生成,人工评测的综合可用率达到56.1%,体现出编辑结果从展示效果向实际生产可用性的提升。 2025-09 Seedream4.0 Seedream4.0将原本相对独立的图像生成与图像编辑能力统一到同一架构中,用户可以混合输入文本和多张参考图,完成文生图、单图编辑、多图编辑、图像组合与连续创作。模型引入世界知识和常识推理,使其在处理物理关系、时间顺序、谜题续写和信息图生成时不再只是匹配视觉风格,而能够先理解约束再生成画面。该版本最高支持4K输出,该模型DiT推理速度相对Seedream3.0提升10倍以上。 2025-12 Seedream4.5 Seedream4.5是在4.0统一生成与编辑框架上的进一步Scaling,重点提升多图创作中的主体识别、参考图保持和画面一致性。模型在编辑人脸、光影、色调和材质时能够更稳定地保留原图特征,并强化海报、品牌视觉和密集文字场景中的排版与小字渲染。 2026-02 Seedream5.0Lite Seedream5.0Lite将图像模型从被动执行提示词推进到“理解意图后再创作”的阶段。模型利用统一多模态架构和世界知识进行视觉推理,能够从模糊指令、参考图变化或现实规律中推断用户真正希望修改和生成的内容,并支持信息可视化、风格迁移和复杂局部编辑。实时检索能力还使模型可以获取天气、时事和流行趋势等动态信息后生成相应视觉内容。 2026-07 Seedream5.0Pro Seedream5.0Pro面向高密度、专业化的视觉内容生产,重点强化复杂信息组织、视觉推理和可控编辑。模型可以生成包含大量文字、图表和结构关系的信息图,并能识别用户在原图上的框选、手写标注和草图指引完成精准修改;图层分离能力进一步方便专业工作流中的后续编辑。该版本还提升摄影级光影与皮肤质感以及多语言文字生成能力。 视频与音视频 2024-09 PixelDance/Seaweed 采用以DiT和Transformer为核心的技术路线,支持通过文本或参考图片生成视频。相关能力重点覆盖复杂多主体动作、镜头运动、主体结构稳定和多镜头内容一致性,使视频生成从单一短镜头逐步走向具有叙事关系的连续画面。 2025-06 Seedance1.0 Seedance1.0将文字生成视频和图片生成视频统一到同一基础模型中,并显著提升复杂动作、提示词遵循和主体运动稳定性。模型原生支持多镜头叙事,可在10秒视频中完成2至3次远景、中景和近景转换,同时保持主体、风格和场景关系连贯。其最高支持1080p输出;官方在NVIDIA20上的测试显示,生成5秒1080p视频约需41.4秒。 2025-12 Seedance1.5Pro 其采用双分支DiffusionTransformer架构,并通过多阶段蒸馏、量化和并行优化实现超过10倍的端到端推理加速。该模型能力从纯视频生成升级为原生音视频联合生成,可以在生成画面的同时合成人声、环境音和配乐,并保持声音节奏、口型和人物动作之间的时间同步。模型支持多种语言和方言,能够处理连续长镜头、快速运镜、复杂动作以及短剧和广告所需的情绪表达与叙事连贯性。 2026-02 Seedance2.0 进一步将文本、图像、视频和音频四类输入统一到音视频联合生成架构中,使创作者可以直接引用已有素材的角色、构图、动作、运镜、节奏和声音特征。单次任务最多可输入9张图片、3段视频和3段音频,并生成15秒多镜头音视频;模型同时支持指定片段修改、视频延展和双声道音频输出。 2026-06 Seedance2.5 在Seedance2.0四模态输入和音视频联合生成基础上,Seedance2.5将单次原生生成时长提升至30秒,支持最多50个参考素材,并进一步强化可编辑输出、局部修改和连续叙事控制,并将支持4K视频生成。 数据来源:字节跳动 Seed 官网及技术报告、智东西、IT 之家、广发证券发展研究中心 图 4: Seedance Arena 排名 Hide Filters Models Labs Rank Rank Spread Model Score ↓ Votes 1 1 → 3 wan3.0Alibaba · Proprietary 1414 ±26 463 2 1 → 3 dreamina-seedance-2.5-720pBytedance · Proprietary 1410 ±26 429 3 1 → 5 minimax-h3MiniMax · minimax-h3-community-license-agreement 1392 ±19 962 4 3 → 5 gemini-omni-flashGoogle · Proprietary 1367 ±15 2,109 5 3 → 5 dreamina-seedance-2.0-720pBytedance · Proprietary 1365 ±14 3,852 6 6 → 6 happyhorse-1.0Alibaba-ATH · Proprietary 1307 ±14 3,116 数据来源:Arena.ai 官网、广发证券发展研究中心 图 5: Seedance 2.5 绿幕编辑能力演示  把@视频1绿幕背景渲染场景、障碍、服装和配角:0-4秒:秒户外训练,障碍换石头、砖块、轮胎、木箱;4-10秒:休息室,朋友鼓励;10-15秒:国际赛场,训练杆换原创防守球员和门将,主角进球。整体写实电影级。 数据来源:字节跳动Seed官网、广发证券发展研究中心 ## (三)语音模型迭代 语音与音频模型由语音识别、理解和合成相互串联的级联架构,逐步转向理解与生成一体化的端到端架构。豆包实时语音大模型和Seeduplex先后增强自然语音交互、全双工对话及复杂环境下的打断处理能力;SeedAudio1.0则将能力进一步拓展至配乐、环境音等音频内容生成;SeedRealtime则在实时语音基础上结合视觉输入,使模型能够同时理解声音、画面和时间变化。 表 3:字节语音与音频大模型迭代 时间 模型/系列 具体能力 2025-01 豆包实时语音大模型 Seed1.5原生语音能力将语音理解和语音生成直接纳入基础模型,而不是完全依赖独立的语音识别、语言模型和语音合成模块串联。该架构有助于保留语气、节奏和上下文信息,并降低级联链路的信息损失和交互延迟,使豆包可以提供更自然的实时语音对话。 2026-04 Seeduplex 将豆包此前以轮流问答为主的半双工语音交互升级为原生全双工框架,使模型可以在输出语音的同时持续监听、理解用户及周围声学环境。模型能够识别用户停顿、思考和打断意图,并在多人说话或存在背景噪声时抑制无关声音,从而动态决定继续倾听、开始回答或停止输出。官方数据显示,其复杂场景抢话比例下降40%,判停延迟减少约250毫秒,误回复率和误打断率较半双工方案降低约一半。 2026-07 SeedAudio1.0 定位为面向全场景音频生成的模型,目标是支持端到端的电影级音频创作,并将声音生成从实时对话扩展至更完整的内容生产环节。 2026-08 SeedRealtime 原生音视频模型,联合理解声音、画面和时序信息,支持实时看、听、说的交互。 数据来源:字节跳动 Seed 官网、广发证券发展研究中心 整体来看,字节模型迭代呈现两项主要趋势:一是由通用模型扩展为覆盖图像、视频、语音和音频的多模态矩阵,二是由内容理解与生成转向工具调用、Coding和Agent任务交付。其中,视频及音视频生成与字节既有内容业务的结合更为直接,是其相较多数通用模型厂商更具辨识度的能力方向。 截至 2026 年 9 月,字节已形成覆盖通用 Agent、内容生产、实时交互及检索的模型矩阵。主要系列包括 Seed2.1、Seedream、Seedance、Seeduplex、SeedAudio 和 Seed-Embedding;Coding 方向亦持续更新 SeedEvolving 等模型服务。相关能力通过豆包、即梦、剪映、TRAE 等产品进行应用验证,并由火山方舟向企业和开发者提供 API 服务。 表 4:字节跳动当前模型矩阵 模态/最新系列 定位与迭代 核心能力 通用/Agent Seed2.1Pro/Turbo 面向通用Agent与软件工程任务;官方展示其可进行项目规划、文件处理、工具调用和多步骤交付,并覆盖需求理解、编码实现、缺陷修复和结果验证。另覆盖知识、推理、视觉/视频理解及长上下文任务。 Coding/Agent SeedEvolving 火山方舟产品线定位为持续优化Coding/Agent能力的模型服务,适用于代码和Agent长任务;本报告只引用产品页定位,不推断其是否对应一个固定权重快照。 图像生成/编辑 Seedream5.0Pro/Lite 具有推理式图像创作能力,面向高信息密度和复杂版式,支持空间标注/草图驱动的精细编辑、图层拆分、人像与光影生成,并支持10+语言的文字生成与理解。 视频/音视频 Seedance2.0Standard/Fast/Mini 支持文本、图片、音频和视频输入;采用统一音视频联合生成,支持多模态参考和编辑,强调运动与物理稳定性、原生音画同步及导演式控制,适用于广告、影视和社交营销。 语音/音频 Seeduplex/SeedAudio1.0 面向语音交互和音频生成方向。对外产品还包括实时语音、声音复刻、TTS、ASR、翻译和音乐能力。 向量/检索 Seed-Embedding 面向文本、图像和视频的向量化检索及跨模态语义匹配,为知识库、搜索、推荐和RAG提供表示层能力。 数据来源:字节跳动 Seed 官网、火山引擎官网、TRAE 官网、广发证券发展研究中心 ## 四、商业化路径:视频链形成内容资产,Agent链推进任务交付 我们认为,字节大模型商业化的核心,是依托 Seed 模型与火山方舟工程体系,沿视频内容生产和 Agent 任务执行两条路径,将模型能力转化为可收费产品或可衡量的经营效率。视频链交付可编辑、可分发的内容资产,Agent 链交付跨工具完成的任务结果;集团内部业务、专业创作应用和企业服务构成三类价值回收出口。现阶段,视频生成是字节相对明确的差异化能力,Agent 则是头部厂商的共同方向。字节的潜在差异化,在于由 Agent 调度视频模型和内容工具,并进一步连接内容分发、广告及交易环节。 图 6:字节跳动大模型业务商业化路径  数据来源:字节跳动 Seed 官网、火山引擎官网、TRAE 官网、扣子官网、CapCut 官网、TikTok for Business 官网、广发证券发展研究中心 ## (一)视频链:从生成内容资产到商业转化 字节视频链已经覆盖模型生成、创作工具和内容平台等主要环节,具备进一步向广告及交易转化、效果反馈延伸的业务基础。Seedream 负责图片、分镜和视觉素材生成与编辑,Seedance 负责视频及音视频生成;即梦承担创意生成入口,豆包承担通用用户入口,剪映/CapCut 负责剪辑、包装、版本适配和成片交付,抖音、TikTok 等内容平台及集团广告、电商体系则提供分发和商业转化环境。相较于仅拥有视频模型或单一生成应用的厂商,字节拥有覆盖生成、编辑、分发和交易环节的资产组合,更具形成内容生产与变现闭环的条件。 Seedance 由早期单镜头生成逐步发展至多镜头叙事、主体一致性和原生音视频联合生成。量子位智库月报显示,在 Seedance 2.0 加持下,即梦“小云雀”相关指标增长超过 120%,网页端即梦亦持续霸榜;这一产品侧验证说明视频模型能力提升正在转化为即梦等创作工具的实际使用增长。Seedance2.0 解决了多模态素材引用、音画同步、视频延展和局部修改等问题,最新公布的 Seedance2.5 则进一步将单次原生生成时长提升至 30 秒,并扩大参考素材规模、强化可编辑输出。其商业意义不只是生成更长的视频,而是有望减少多段素材拼接、整段重新生成和跨工具返工,使视频模型更接近广告、电商、短剧和影视制作中的连续生产环节。视频链的商业价值主要体现在内部效率、应用收费和外部模型服务三个方面: (1)在集团内部,模型可用于广告素材、电商内容和平台内容制作,通过缩短制作时间、增加测试版本等方式改善效率。TikTok于2026年4月宣布将Seedance 2.0引入Symphony,8月进一步向部分付费广告主开放Seedance 2.5,覆盖Creative Studio、Ads Manager及自动化接口等入口。 (2)即梦、剪映/CapCut等创作应用可以通过会员、创作额度及专业功能形成直接收费,豆包亦已推出面向高阶任务的付费服务。 (3)火山方舟向企业和开发者提供模型调用及配套云服务,图像、视频等能力按对应产品规则计费。 图 7:字节在视频生成、编辑、分发和交易环节均可回收价值  数据来源:字节跳动Seed官网、火山引擎官网、扣子官网、CapCut官网、TikTok for Business官网、广发证券发展研究中心 ## (二)Agent链:复杂任务和多模态能力进入竞争前沿,产品体系覆盖模型至企业部署 Seed1.8 已将搜索、Coding 和 GUI 操作统一到通用 Agent 模型中,Seed2.0 进一步推出 Pro、Lite、Mini 及 Code 系列,Seed2.1 进一步强化办公、研究、软件工程及多模态任务的端到端交付能力。豆包承担大众用户入口,TRAE Work 面向研究、写作、数据分析、规划协同与端到端编程,扣子负责 Agent、知识、记忆、技能、插件和工作流装配,火山方舟负责推理、上下文管理、容量、评测与企业部署。字节已形成从模型、应用、开发平台到企业基础设施的产品链条。 Agent 的商业价值在于稳定完成文件处理、研究、代码开发和企业流程等任务。其变现方式可以由模型 API 逐步扩展至个人专业订阅、团队席位、Agent 平台资源、专属容量和企业部署。 图 8:字节 Agent 变现方式由模型调用向席位、平台资源和企业部署扩展  数据来源:字节跳动 Seed 官网、TRAE 官网、扣子官网、火山引擎官网、QuestMobile、广发证券发展研究中心 图 9: TRAE 办公助理使用场景演示  数据来源:TRAE官网、广发证券发展研究中心 从公开能力及同口径评测看,Seed2.1Pro 已经进入全球前沿竞争区间,但不同任务表现存在差异。在通用 Agent 方面,其 AgentStartupBench 表现较强,但 WorkspaceBench 和 xDailyBench 仍低于 GPT-5.5 及 Claude Opus 4.7;在 Coding Agent 方面,NL2Repo-Bench 略高于 GPT-5.5,但 TerminalBench2.1 和 SWE-Atlas 仍落后;多模态任务是其相对更具优势的能力方向。 表 5: Seed 2.1 Pro Agent 细分能力测试结果 基准 Seed2.1Pro ClaudeOpus4.7 GPT-5.5 Gemini3.1Pro 通用Agent WorkspaceBench 53.0 55.1 58.7 32.8 AgentStartupBench 68.8 62.3 68.1 45.7 xDailyBench 61.0 69.0 73.0 35.2 CodingAgent NL2Repo-Bench 47.0 58.2 45.1 33.4 多模态Agent TerminalBench2.1 71.0 71.7 73.8 70.7 SWE-Atlas 35.2 38.7 44.7 23.6 MathVision, w.tool 94.5 83.1 92.2 89.2 MMMU-Pro, w.tool 82.7 74.0 81.2 80.5 WorldVQA 53.0 35.9 34.6 44.3 ERQA 72.0 52.5 64.5 70.8 数据来源:字节跳动 Seed、广发证券发展研究中心 ## (三)关键经营指标 豆包已形成较大的消费端用户基础。QuestMobile 数据显示,2026 年 6 月豆包 MAU 达到 3.82 亿,其中使用时长超过 10 分钟的用户占比为 27.5%,App 端较 5 月新增 1,378 万用户;同期千问、DeepSeek 月活分别为 1.67 亿和 1.30 亿,豆包呈断层式领先,且同比增长 172.1%。头部集中与马太效应进一步强化了豆包消费端入口的稀缺性。用户规模和深度使用比例说明,字节具备在高频交互中发现用户需求、分发新模型能力并尝试增值收费的基础。 图 10:移动端豆包 MAU(万人)  数据来源:QuestMobile,广发证券发展研究中心 图 11:主要 AI 原生应用月活(亿人)  数据来源:QuestMobile,广发证券发展研究中心 豆包大模型…
AI 解读
Seedance 2.5能力升级:单次生成30秒、支持50个多模态参考素材及指定片段修改;Seedance 2.5接入TikTok Symphony,向部分市场付费广告主开放,开辟广告素材变现渠道