DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽|调用|系列模型|flash|agent|deepseek_网易订阅
发布时间:2026-08-09 21:23:21 作者:玩站小弟
我要评论
出品|虎嗅科技组作者|宋思杭编辑|苗正卿头图|视觉中国这是进击的独角兽第31篇,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模型独角兽公司
。

出品|虎嗅科技组作者|宋思杭编辑|苗正卿头图|视觉中国这是又更用系易订阅进击的独角兽第31篇,该系列关注月之暗面、新次型智条件、梁文列模MiniMax、锋没放阶跃星辰、招进零一万物、独角百川智能、兽调面壁智能和DeepSeek共8家大模型独角兽公司。又更用系易订阅梁文锋的新次型热度一直在AI圈的Top级,尤其是梁文列模今年。从V4预览版发布,锋没放到后来的招进融资与IPO传闻,再到一份流传甚广的独角四小时谈话实录,DeepSeek的兽调每一次动作,都能高效高效成为行业话题。又更用系易订阅7月31日下午,DeepSeek又更新了。这次,DeepSeek只是在API文档的更新日志里宣布,V4-Flash正式版API上线公测。从“正式版”和“公测”两个词同时出现来看,这并不是V4的最后形态。DeepSeek也特意强调,本次更新只包含V4-Flash的API,V4-Pro及App、Web端模型均未发生变化,V4-Pro正式版还关键再等等。但这次更新依然值得关注。从最新版本来看,V4-Flash-0731没有变化模型架构和参数规模,只重新开展了一次后训练。更新后,DeepSeek把几乎所有篇幅都用来强调它在Agent,尤其是Code Agent上的发展。这意味着,V4-Flash并不是一次便捷的模型更新。DeepSeek正在尝试回答一个新的状况:到了Agent时期,一家公司最需的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型?这一次,DeepSeek没有后续堆参数V4-Flash并不是7月31日才首先次出现。4月24日,DeepSeek发布V4预览版时,已经同时推出V4-Pro和V4-Flash。两者都是MoE模型,但体量差距明显:V4-Pro具有1.6万亿总参数,每次推理激活49B参数;V4-Flash具有284B总参数,每次只激活13B参数。两款模型均协助100万Token上下文。在DeepSeek的定位里,Pro负责能力上限,Flash负责效率。参数规模更大的V4-Pro,在世界知识以及高难度Agent任务上谝更好;V4-Flash则可以通过提高思考预算,在部分推理任务上接近Pro。换句话说,Flash牺牲了一部分知识容量,却用更小的激活参数换来了高效度和成本。7月31日的更新没有变化这套架构。DeepSeek清楚表示,V4-Flash-0731与预览版的模型结构、尺寸完全相同,仅重新开展了后训练。但就是这次后训练,让V4-Flash的Agent能力出现了明显变化。按照DeepSeek公布的结荚,V4-Flash-0731在Terminal Bench 2.1上实现82.7,在NL2Repo上实现54.2,在DeepSWE上实现54.4,在Toolathlon Verified上实现70.3。DeepSeek称,这些结荚已经大幅超过V4-Pro预览版。这件事的意义在于,DeepSeek没有通过提高参数和重新预训练,来提高模型的Agent能力。用通俗的话来讲就是,DeepSeek虽然后续在追求AGI,然而并没有通过一味地提高参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、实施代码,并在更首先的任务轨迹中减小错误。过去,大模型公司的题竞争发生在预训练时期。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent时期后,模型能力不再完全由预训练决定。一个模型会不会采取终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知方式什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的实施框架。V4-Flash的变化,恰好验明正身了这一点。这也是为什么,DeepSeek这次除了更新模型,还原生协助了Responses API,并专业适用配Codex。同时,DeepSeek在测试Code Agent任务时,采取了尚未正式发布的DeepSeek Harness minimal mode。换句话说,这些Agent成绩不完全属于模型本身,而是属于“模型、推理预算与Harness”共同组成的系统。这当然也意味着,目前公布的数据仍需谨慎看待。一部分,部分结荚来自DeepSeek内部测试集;另一部分,DeepSeek Harness尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版V4-Flash究竟比预览版发展了多少,还需等待独立评测以及真实开发场景验明正身。但至少从这次更新可以看出,DeepSeek正在从只给予模型和API,向Agent所需的实施环境多走一步。但DeepSeek目前还没有亲自做一个完善的Agent产品,却最初给予让模型进入Agent工作流所必需的接口、适用配和Harness。这是一种特别克制的产品化。为什么是Flash?既然V4-Pro的能力上限更高,DeepSeek为什么不先更新Pro?最直接的因素是,Agent并不是一次模型调用。在聊天机器人时期,用户提出一个状况,模型生成一次答案,一次交互就结束了。但在Agent任务里,模型需先理解目的,再拆解任务、检索材料、调用工具、读取结荚、修正错误,最后实现交付。一个复杂任务,可能涵盖几十次甚至数百次模型调用。这时,模型单次推理提高的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但高效度更慢、成本更高的模型,未必能带来更好的实际结荚。Agent真正需的,频仍不是每一步都调用能力最强的模型,而是在不过大多数步骤中,采取一个能力足够、价格更低、响应更快的模型。这正是V4-Flash的价值。根据DeepSeek技术报告,在100万Token上下文下,V4-Flash单Token推理所需的方式算量,约为V3.2的10%,KV Cache则约为V3.2的7%。它的总参数只有V4-Pro的约六分之一,每次激活参数也只有Pro的约四分之一。这种差距最后也体目前API定价上。目前,V4-Flash每百万Token未命中缓存的输入价格为1元,输出价格为2元;V4-Pro分别为3元和6元。V4-Flash的并发限制为2500,Pro则为500。Responses API目前也只有V4-Flash协助,V4-Pro预方式到8月初才会接入。在V4的产品体系里,Pro负责说明DeepSeek的模型能力能够实现什么位置,Flash则负责承担真正高往往、首先链条的Agent任务。前者是能力模型,后者更像生产模型。梁文锋曾在内部公开说方式,“模型应该放在相同成本下比较;在现时期,Coding Agent的优先级高于其他垂直Agent。”从这个角度来看,V4-Flash此次更新的方向,确实与这两个判断形成了呼应。DeepSeek没有选项通过扩大参数,让Flash在所有能力上追上Pro;它选项在模型架构不变的状况下,通过后训练和Agent框架,提高Flash实现真实任务的能力。这背后是一种更现实的方式算。如果Agent最后关键进入企业和开发者的日常工作流,那么决定模型能否被大规模采取的,不只是Benchmark,而是实现一个任务需多少时间、消耗多少Token,以及最后成功率是多少。然而,这也是V4-Flash目前最需说明的地方。DeepSeek公布的Agent成绩大多采取Max reasoning effort实现。更高的思考强度常见意味着更首先的推理流程和更多Token消耗。一个模型每百万Token的价格很低,不等于实现一项任务的总成本一定更低。如果V4-Flash需消耗更多Token才能实现接近Pro的成效,那么它在单价上的好处,可能会被更首先的任务轨迹部分抵消。因此,真正有价值的比较,不是V4-Flash在某一项Benchmark上超过了谁,而是在实现同一个Agent任务时,它与V4-Pro、Kimi、GLM以及闭源模型分别需多少Token、多少时间和多少次重试。DeepSeek暂时还没有给出这个答案。本文来自虎嗅,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp
相关文章

火箭后场实力大增!范乔丹自信将扫质疑+桑顿引盛赞+斯玛特提升防守
26-27赛季健康的范弗利特将重返火箭队,这已经让火箭的后场硬实力得到提升,因为他才是火箭唯一纯正的PG,谢泼德的组织能力、持球能力都不尽如人意。除此之外,火箭还在今夏引进了斯玛特、博格丹增加后场实力2026-08-09
这访谈霸气十足,布鲁诺·费尔南德斯谈及与阿马德的对话-英超-曼联专区-虎扑社区
阳七七七(9级)楼主2026-08-05 07:29:13发布于温哥华这访谈霸气十足,布鲁诺·费尔南德斯谈及与阿马德的对话由阳七七七发表在曼联专区https://bbs.hupu.com/manutd2026-08-09
数名院士呼吁糖尿病患者停止食用,比甜食还粘血管,趁早撤下餐桌|淀粉|浓汤|顿顿|菓子_网易订阅
社区医院的内分泌门诊里,62岁的李师傅拿着体检报告直皱眉。他得2型糖尿病快7年,平日里对自己管得格外严:月饼糕点碰都不碰,奶茶饮料更是想都不想,连水果都只敢啃两口番茄黄瓜。按他的话说,“甜的东西我全戒2026-08-09
宏远干保密局出身的吗 现在连刘料都没有-CBA-广东华南虎-虎扑社区
Chuckcloseyyy(23级)楼主2026-08-06 00:04:52发布于广东宏远干保密局出身的吗 现在连刘料都没有由Chuckcloseyyy发表在广东华南虎https://bbs.hup2026-08-09
盛美上海股价跌5.01%,前海开源基金旗下3只基金重仓,合计持有42.06万股浮亏损失654.39万元
7月23日,盛美上海跌5.01%,截至发稿,报295.06元/股,成交8.79亿元,换手率0.61%,总市值1423.95亿元。资料显示,盛美半导体设备(上海)股份有限公司位于中国(上海)自由贸易试验2026-08-09
为何只有中国在“逐步电动化”,国外却以油车为主,问题出在哪?|特斯拉|电动车|新能源车|汽车行业_网易订阅
前阵子两件连着出来的汽车圈大新闻,给我看愣了。一边是有着88年历史的老牌车企大众,要全球裁员10万人关闭德国四座工厂,是这家巨头史上规模最大的重组。另一边欧盟直接给喊了好几年的2035禁售燃油车松了口2026-08-09

最新评论