
Postare
Roger波杰克🐎
模型没改一个字,Harness 却让它长了本事
DeepSeek V4-Flash 这次发的"正式版",本质不是新模型。
架构没动,参数没加——Flash 还是 2840 亿总参、130 亿激活;Pro 是 1.6 万亿 / 490 亿,差一个数量级。官方原话就一句:"仅重新进行了后训练"。
没换发动机,只重调了变速箱和驾驶策略。
结果 Agent 能力一下子跳到接近 Pro:TerminalBench 82.7、DeepSWE 54.4、Cybergym 76.7。
这事儿值得盯,是因为它恰好验证了崔添翼进 DeepSeek 要干的那件事。
崔添翼是谁?浙大加六枚 ACM 金牌,Jane Street 量化九年,今年三月被梁文锋挖来组建 Agent 团队。
他给的公式很直白:Model + Harness = Agent。
Harness 是啥?
说白了,就是套在模型外面、让它能真正接任务、调工具、自己跑起来干活的那套系统。模型是发动机,Harness 是方向盘、刹车。没有它,模型再聪明也是个裸 API,跑不了真实任务。
他的切入点妙在:量化交易和 Agent 底层逻辑同源——都是上下文管理、工具调用、终端执行、权限控制。
量化不堆算力,是在噪音里筛信号、精准路由。这套"信号过滤 + 路由执行",被他搬到了模型框架上。
一句话:Harness 不是让模型更聪明,是让便宜的 token 变有用。小模型配好 Harness,能打赢大模型加糙 Harness。
为什么这能替代堆参数?
预训练是灌知识(多聪明),后训练是岗位带教(教怎么把事办完)。
这次证明:130 亿激活的小 Flash,靠重训加自家 Harness 环境,Agent 成绩逼近 490 亿的 Pro。
→ 模型规模不再是 Agent 能力的唯一决定因素,训练方法、数据质量、Harness 的权重在上升。
但要泼盆冷水:Harness 和内部测试集没公开,第三方还没复现,暂时不能断言"后训练已可替代扩容"。
这条路线直接打 Agent 应用层的"毛利危机"——Cursor、Devin 这类产品,被 OpenAI、Anthropic 的旗舰账单吸走大半订阅费,沦为"算力劳务派遣"。
DeepSeek 的逻辑:用便宜 token 加自家 Harness,把成本压下来、可控性提上去,切 OpenAI 后院。
→ 看 AI 应用公司,同一个模型换 Harness 结果天差地别。未来估值要看"模型 × Harness"复合能力,不是单看参数。
所以下一仗,是模型还是 Harness?

Declinarea responsabilității: conținutul OKX Orbit este furnizat doar în scopuri informative. Aflați mai multe
Răspunsuri
Încă nu există niciun comentariu. Fiți primul care răspunde!
Mediatizate pe piață astăzi
1#SoftPCEStrongDemand
Populare


2#AMZNMissesButRallies
Populare

3#MSFT450BInADay

