万字长文拆解DeepSeek V4 Pro与Harness:从后训练到「代理自进化」,更大的变化在开源框架里
不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。(雷峰网) 从 1812 年黑格尔的辩证法,到马克思、列宁,再到 1915 年毛泽东在延安写下的《矛盾论》,一百多年里,这套思想最终落到了一个很实际的问题上: 复杂事物中矛盾很多,但真正重要的是找到决定其他矛盾的主要矛盾。 今天的大模型行业也不例外,当前大模型行业面临的主要问题有以下这些: 1. 模型能力的增长速度,同把这种能力转化成可靠产出的能力之间的矛盾(模型强,但产出物没价值) 。 2.算力资源受限,同能力需求无限之间的矛盾(人们总吐槽 AI 太傻)。 3.单价在快速下降,同真实账单在上涨之间的矛盾(模型便宜了,但每个月花的更多了)。 4.要做通用智能,同要交付一个能用的产品之间矛盾(简单的不好用,好用的不简单)。 这些矛盾才构成了交错向上发展的行业和机会。 没有人能逃避这些选项, DeepSeek 也一样。 我们对 deepseek-v4-Pro以及 Harness 做了几轮实测:直接打接口的探针、七次编码任务运行(其中四次是只改一个变量的对照)、把上下文压到 92 万 token 的位置测试,加上把它 19.8 万行源码和 21.7 万行测试过了一遍。试图来回答以下问题: 1. v4- Pro 这个模型到底怎样,比 flash、preview 版本有哪些不同? 2. 好多网友反馈接入其他 Harness 会降智是怎么回事? 3. 使用成本到底怎么样?能否量化? 4. Harness 解决什么问题?什么人适合它? 总而言之,这几天的研究和使用下来还是很精彩的, 我们甚至能透过 v4- Pro 和 Harness 管中窥豹,看到一些 DeepSeek 对技术、对人性,甚至对世界的判断和认知。 01 先看模型:DeepSeek V4 Pro 到底强在哪里? Pro 很可能重做了一次非常先进的后训练 Pro和 Flash 这两个模型其实有挺多版本,我们一次性拉出来看下: 【Provs Flash 全参数对照,含字段释义】 我们会发现两个有意思的结论: 1.Pro 对比 flash,模型本身的层面在深度、宽度、注意力、专家池以及专家内部宽度都有很大进展。 2.但这五个维度都是预训练阶段就定性的,不是后训练带来的变量。 (有一样是 相同 的:每个 token 实际只激活 6 个专家,两个模型都是 6。) 还有一处彩蛋,后面会再 call back: deepseek Harness 的出厂默认模型写的是 deepseek-v4-flash。 【packages/bundle/base/cordis.patch.yml 里 agent-default-model 】 为什么 Pro 正式版拖到 Flash 转正之后才公布?坊间其实预测 Pro
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。