“1,目前国内主要模型公司,蒸馏... 1,目前国内主要模型公司,蒸馏现状如何? 关于模型蒸馏,主要有三点观察。 第一,国内过去在蒸馏技术上的应用非常普遍和深入。 第二,当前OAI和Claude的反蒸馏措施已颇为有效,其主要效果并非阻止访问,而是将蒸馏方的成本提高了十倍以上,导致经济账需要重算。这一变化也影响了国内专业模型公司的战略。在OpenAI和Anthropic加强反蒸馏措施后,这些专业模型公司不约而同地将研发重心从大尺寸模型转向了轻量级模型,以应对蒸馏成本的重新评估 第三,关于Z]自己,存在两个制约因素。其一,蒸馏效果受限于学生模型自身的能力和容量…”
关联内容单元 #1725 · 原始来源原始全文
1,目前国内主要模型公司,蒸馏... 1,目前国内主要模型公司,蒸馏现状如何? 关于模型蒸馏,主要有三点观察。 第一,国内过去在蒸馏技术上的应用非常普遍和深入。 第二,当前OAI和Claude的反蒸馏措施已颇为有效,其主要效果并非阻止访问,而是将蒸馏方的成本提高了十倍以上,导致经济账需要重算。这一变化也影响了国内专业模型公司的战略。在OpenAI和Anthropic加强反蒸馏措施后,这些专业模型公司不约而同地将研发重心从大尺寸模型转向了轻量级模型,以应对蒸馏成本的重新评估 第三,关于Z]自己,存在两个制约因素。其一,蒸馏效果受限于学生模型自身的能力和容量。当前的模型能力要么因处于持续训练中而无稳定版本,无需蒸馏;要么稳定版本的水平较低,没有必要去蒸馏GPT-6这类顶级模型。其二,Z]自2025年初官方已宣布停止蒸馏。后续未再进行大规模蒸馏,主要是因为其模型一直处于训练迭代中。 2,模型蒸馏的成本构成是怎样的,以及近期成本显著上升十倍的具体原因是什么? 模型蒸馏的投入主要分为三个环节。第一是购买API的直接资金投入,尤其是在账号可能被封禁的情况下,需要持续投入资金开设新账号。第二是人力、算力和时间的投入,这包括研发用于生成高质量提示词的专门模型,以及对提示词进行分析、筛选和管理。第三是工程系统的投入,蒸馏过程需要通过多轮、递归式的提问来深挖目标模型的完整思维链和推理步 骤,这会产生海量的交互数据(每日可达数亿甚至数十亿条),需要建立相应的大数据管理体系进行处理。 在当前OpenAI和Anthropic的反蒸馏措施下,成本上升最显著的是第一个环节,即API购买成本。具体来看: GPT-6等新模型不再直接展示思维链,甚至取消了模型思考深度的选项。这迫使蒸馏方必须通过更多轮次的提问来还原其思考路径。原先通过2到5次提问就能获取的信息,现在可能需要10次、25次甚至30次,导致API调用成本直接上升5到10倍。同时,账号被封禁的风险也更高。 Anthropic则采取了另一种策略,它会限制用户对单一问题进行创根问底式的追问。例如,当连续追问一个敏感或复杂话题(如核武器原理)到一定深度(如三至五个问题)时,账号就可能被封禁。为了规避这一机制,蒸馏方需要在核心问题周围插入大量其他问题进行混淆和掩饰,可能需要用十几个问题来铺垫一个真正想问的问题。这同样大幅增加了API的调用量和封号成本。 综合来看,仅API采购环节的成本就至少上升了5倍,甚至超过10倍,具体取决于问题的复杂度。第一环节成本的剧增,也相应加重了第二和第三环节在人力、算力及工程系统上的负担。 3,如果OpenAI等领先企业不再提供''思维链”等技术捷径,国内模型厂商若要达到同等效果,其研发成本将如何变化?这种变化对国内厂商的研发路径和行业格局可能产生怎样的长期影响? 若OpenAI等公司提高技术门槛,不再提供''思维链”等便利,国内模型厂商为达到同等效果,其研发过程将变得更为复杂。首先,需要生成更多、连贯性更强的问题,这将直接导致中间环节的投入增加和数据量的激增。其次,工程系统的存储需求和复杂度会随之升高,而当前存储成本依然高昂。综合来看,整体成本将显著上升。对于能力较强的公司,成本增幅预计在五倍以上;而对于能力稍弱的公司,直接的现金成本增幅可能高达十倍。 这种变化将促使国内厂商在发展路径上做出选择。如果部分公司仍倾向于用资金投入换取短期效果的“捷径”,那么行业受到的影响可能不大。然而,如果领先企业持续抬高技术壁垒,国内公司最终将被迫回归到更扎实、更基础的研发道路上来。届时,行业可能会出现一种新的态势:领先的海外公司API收入或许会略有下降,而国内公司的研发成本增速将放缓,研发周期相应拉长,模型迭代速度变慢,但其发展路径会走上正轨。 4,如何看待国内外互联网大厂在模型能力上的表现普遍不及独立的专业模型厂商?这是否源于组织架构或考核机制的差异?展望未来,尤其是在国内市场,字节跳动和阿里巴巴等大厂在算力资源上具备优势,当其模型参数量达到5T级别后, 国内独立模型厂商是否还能在通用或特定领域保持领先地位? 在海外,Meta和Google是典型案例。Meta的Llama模型初期与自身业务结合良好,但在看到OpenAI等公司的API收入快速增长后,其精力被分散,急于进入API市场,对模型提出了''既要又要”的过高要求,导致模型研发节奏被打乱,走了一段弯路,目前才调整回以个人Agent为中心的业务节奏。Go0gle的问题则不同,其技术在GPT-3时期已实现,但因模型推理的算力消耗过大而无法商业化,本质上是技术实现与算力成本不匹配的问题。 国内大厂的情况则更为复杂,呈现出一种循环。Z)在2024年起步阶段就出现战略失误,在大模型本身尚未训练成熟时便急于推出十几个App。DeepSeek、KIMI和智谱等公司早在2023年之前就已开始深耕训练,阿里巴巴的''通义千问”本有稳定的技术积累,但后来受“豆包”日活数据的吸引,将战略重点转移到应用,影响了自身迭代节奏。腾讯最初认为大模型对其核心业务并非必需,但在发现阿里和字节开始侵蚀其业务根基后,又仓促地进行战略补防,显得较为慌乱。但后期在算力上加码,workbuddy场景切的很准,有了稳定用户基本盘 5,对于国内的5T级别大模型,预计将由独立模型厂商还是大型科技公司率先推出?其技术路径是基于多模态应用驱动还是在算力受限下选择MoE架构的结果? 预计国内的5T级别模型大概率会首先由像KIMI这样的独立模型公司推出。根据当前了解到的情况,A自身的5T路径主要体现在''千问4''的多模态输入版本,而非核心的、基于标准MoE架构的大语言模型。目前也是KIMI在明确地推动其标准大语言模型向3T以上参数量发展。DeepSeek之前也有媒体报道从合家进度KIMI当前的模型参数量已接近3T,预计在2026年底至2027年初,有很大概率能推出一款超过3T的标准大语言模型。 A在林俊旸离职后,研发节奏受到了一定影响。原计划于2026年八九月份发布的”千问4”标准版要对齐Gemini能力的目标,从近期云栖大会上透露的模糊信息来看,其多模态标准输入能否实现存在疑问。预计在10月下旬''千问4''正式开放后,可能会呈现两种情况:其文本方向的模型参数量大约在3T上下;而其多模态输入分支版本,若能实现,根据模型结构推断,参数量将接近5T。不过,其标准文本模型在未来三到四个月内,很有可能被KIMI反超。 展不顺,则可能在2T至2.2T之间进展顺利的话,预计在2026年12月可以发布参数量超过2T的标准大语言模型,最乐观的情况下可能达到2.8T或3T;若进展不顺,则可能在2T至2.2T之间。
AI 解读
OpenAI/Anthropic反蒸馏措施使蒸馏成本结构性上升10倍以上,迫使国内公司从大尺寸模型转向轻量级模型;蒸馏成本结构被首次系统拆解为API、人力算力、工程系统三环节,其中API环节涨幅最大