南宫娱乐相信品牌的力量-DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战

2026-08-06 17:04:09

首页财产阐发评论ai正文 DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战 7月31日DeepSeek官网显示DeepSeek-V4-Flash正式版API上线公测,其于多项测试中体现迫近甚至逾越V4-Pro预览版,激发存眷。 2026-07-31 15:37 ·凤凰网 Dale 编纂 董雨晴 Dale 编纂 董雨晴 AI投资人解读· DeepSeek-V4-Flash正式版API上线公测,多项Agent基准测试体现迫近甚至逾越V4-Pro预览版。其经由过程后练习晋升能力,表示练习要领等权重上升。官方还有针对于Agent框架优化,且将推出Harness计划。· 行业竞争激烈,全世界Agent能力第一梯队由闭源巨头操纵,国产阵营也于追逐。此外,高估值下DeepSeek面对技能兑现、贸易化等挑战。总结:DeepSeek-V4-Flash正式版揭示技能实力,有潜力切入Agent运用市场,但面对竞争与贸易化磨练,后续成长值患上存眷。

7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发明,DeepSeek-V4-Flash 正式版 API 上线公测。与以往 “Pro 强、Flash 弱”的分层逻辑差别,此次更新开释了一个值患上存眷的旌旗灯号 ——Flash 正式版于多项 Agent 基准测试中的体现,已经经迫近甚至逾越了三个月前 V4-Pro 预览版的程度。

官方更新日记显示,V4-Flash 正式版于 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 54.2 分,Cybergym 76.7 分,Toolathlon verified 70.3 分。而 V4-Pro 预览版于 Terminal Bench 2.0 上的患上分为 67.9 分。

需要申明的是,Terminal Bench 2.0 与 2.1 并不是统一版本的测试集,直接对于比其实不彻底公允。但一个激活参数仅 130 亿的轻量版,于 Agent 能力上跑出如许的分数,已经经于申明后练习阶段的优化空间,可能比纯真堆参数更具杠杆效应。

此外,DeepSeek也尤其申明今朝公测仅限API,App及网页端暂没法体验最新能力。DeepSeek-V4-Pro正式版将尽快发布。

01

“仅从头举行了后练习”

DeepSeek 官方于更新日记中暗示,“DeepSeek-V4-Flash-0731 的模子布局、尺寸及 DeepSeek-V4-Flash-preview 连结一致,仅从头举行了后练习。”

按照 DeepSeek 官方技能陈诉,V4-Flash 总参数 2840 亿,激活参数 130 亿;V4-Pro 总参数 1.6 万亿,激活参数 490 亿。二者于模子范围上相差一个数目级。假如 Flash 能经由过程后练习把 Agent 能力拉到靠近 Pro 的程度,那象征着对于在特定使命而言,模子范围并不是决议性因素 —— 练习要领及数据质量的权重,正于上升。

官方还有尤其注明,本次公然基准测试中的 Code Agent 使命,利用了 DeepSeek Harness 极简模式作为框架举行测试,max 档位,topp=0.95,temperature=1.0。这个细节表示,DeepSeek 可能于 Agent 框架层面也做了针对于性优化,而非仅仅是模子自己的晋升。

这也是DeepSeek官方自研Harness初次以正式定名呈现,此前,梁文锋曾经把AGI的实现路径比作爬楼梯:语言模子是第 一级,去年解决的是CoT(思维链),本年的台阶是Agent,而Agent以后必需解决的问题,是连续进修——让模子像人同样持久堆集经验,而不是每一次都被喂入完备的上下文才能事情。再日后,才是自我迭代的“奇点”与具身智能 。“

AI此刻不缺品位及直觉,它缺的是连续进修的能力”他说,“投资人看Agent,咱们看怎么解决进修。”

连续进修听起来是模子层面的命题,但它的工程落点,偏偏于Harness上。DeepSeek的Agent Harness团队组建在本年3月,挂帅者崔添翼是90后,浙年夜计较机身世,手握6枚ACM亚洲区域赛金牌,曾经于顶 级量化机构Jane Street任职九年,本年3月插手DeepSeek,今后其于5月鼎力大举招兵买马。

据吐露,DeepSeek的Harness计划于V4正式版上线之际同步推出。另据DeepSeek于日记末尾暗示,“DeepSeek-V4-Pro 正式版将会尽快发布。”

02

生态层面的一次正面比武

假如说 2023 年的年夜模子竞争是 “拼通用能力”,2024 年是 “拼长上下文”,那末 2026 年的要害词,毫无疑难是 Agent。

Agent 能力 —— 即模子自立计划、挪用东西、履行繁杂使命的能力 —— 正于成为权衡年夜模子实力的新标尺。从 Terminal Bench(终端操作)、NL2Repo(代码堆栈天生)到 Cybergym(收集安全使命)、SWE-bench(软件工程),一系列 Agent 基准测试正于从头界说甚么是好模子。

从全世界规模看,Agent 能力的第 一梯队今朝仍由闭源巨头操纵。据 benchlm.ai 品级三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列于大都 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也于快速追逐。

DeepSeek 这次将 Flash 的 Agent 能力年夜幅拉升,战略用意很清楚:用高性价比的轻量模子,切入 Agent 运用的重大市场。

究竟,Agent 场景对于推理速率及成本的敏感度,远高在纯对于话场景。一个需要重复挪用东西、多轮推理的 Agent 使命,假如用旗舰模子跑,成本多是 Flash 的数倍甚至数十倍。假如 Flash 能于 Agent 能力上到达 “够用甚兰交用”的程度,其性价比上风将极 具杀伤力。

官方宣布的两个内部测试集也方针明确。DSBench-FullStack(内部全栈开发测试集)患上分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)患上分 59.6。这从侧面印证了 DeepSeek 的定位 —— 把 Flash 打造成开发者及 Agent 运用的首 选底座。

一场生态暗战也于悄然打响,正式版 V4-Flash 原生撑持 Responses API 格局,并针对于性适配了 Codex。

Responses API 是 OpenAI 力推的新一代 API 格局,比拟传统的 Chat Completions,它更合适 Agent 场景 —— 撑持更矫捷的东西挪用、更繁杂的多轮交互、以和更邃密的输出节制。

DeepSeek 原生撑持这一格局,象征着开发者可以更低成当地将基在 OpenAI 生态开发的 Agent 运用迁徙到 DeepSeek 上。这将是两者于生态层面的一次正面比武。

对于 Codex 的适配,则对准了代码天生与软件开发这一垂直场景。Codex 是 OpenAI 面向代码范畴的模子,DeepSeek 针对于性适配,等在直接于 OpenAI 的传统上风范畴倡议挑战。

这些动作放于一路看,DeepSeek 的野心不止在做一个“自制的替换品”,而是要于 Agent 时代成立本身的生态位。

03

500 亿融资以后:高估值下的时间窗口

这次更新,间隔 DeepSeek 完成首轮外部融资不到两个月。

约一个多月前,DeepSeek完成建立近三年来的首轮外部融资,总额超 500 亿元人平易近币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人平易近币 3500 亿元)。投资方声势包括腾讯、宁德时代、京东等财产巨头,以和多家国资财产基金。

7 月中旬,DeepSeek 成心推进新一轮私募融资,投前估值约 710 亿美元(折合人平易近币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。从 520 亿到 710 亿,距离不足六周。

高估值暗地里,是市场对于 DeepSeek 技能实力的承认,也是对于其贸易化远景的押注。但高估值一样象征着高预期、高压力。

据多家媒体报导,DeepSeek 开创人梁文锋本人于首轮融资中出资约 200 亿元人平易近币,经由过程非凡架构紧紧掌控公司节制权。这位脱胎在幻方量化的开创人,此前近三年一直对峙自有资金投入,如今从 “不融资不上市” 转向踊跃拥抱本钱,自己就是一个强烈的旌旗灯号 ——DeepSeek 正于加快冲向贸易化及 IPO。

Flash 正式版的上线,也许可以看做 DeepSeek 于本钱加持下的一次 技能兑现。但真实的磨练还有于后面:Pro 正式版可否准期所致?Agent 能力的晋升可否转化为实打实的收入?于 OpenAI、Anthropic 等巨头的夹击下,DeepSeek 的高性价比线路将怎样阐扬上风。

Agent 战役的年夜幕才方才拉开。DeepSeek 用一个轻量模子的年夜幅进化,给行业出了一道新题 —— 当后练习的盈余被充实挖掘,当效率的晋升最先抵消参数的差距,年夜模子的竞争逻辑,可能要被从头书写了。

【本文由投资界互助伙伴凤凰网授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。

-南宫娱乐相信品牌的力量

下载360浏览器