DeepSeek Harness(DSH)提出了一套全新的AI世界观,其核心可以概括为:将智能体系统(Harness)视为一个“时空可组合的编程范式”,并通过“一切皆插件”的架构,为AI的自进化(Recursive Harness Improvement, RHI)提供结构化的温床。这套世界观主要由三个相互支撑的层次构成:
一、时空可组合性:动态插件的数学基础
DSH的底层是Cordis运行时,它只提供六种原子操作(use、effect、set、get、isolate、intercept),却实现了传统软件难以做到的时间可组合性与空间可组合性。
• 时间可组合性:每个插件对共享环境产生的修改(effect)都必须附带一个“逆操作”(inverse)。当插件卸载时,运行时按相反顺序执行这些逆操作,将环境干净地恢复到插件安装前的状态,而不会像传统系统那样需要重启整个进程。
• 空间可组合性:插件通过“反应式共效应”(reactive coeffects)显式声明自己依赖什么能力(如数据库、日志),以及由谁提供。运行时维护一张动态的依赖拓扑图,当某个依赖出现或消失时,自动激活或停用相关插件。这保证了插件之间既能协作,又能安全拆卸。
这种机制让Harness不再是铁板一块的“底层框架”,而是一个由无数可独立插拔、影响范围可追踪的“零件”组成的有机体。
二、组合泛化:Harness作为高层动作空间
DSH的世界观认为,大模型(基础模型)擅长在训练分布内解决问题,但面对全新任务时,真正需要的是组合泛化能力——即把已有能力重新组合成新解法,而不是重新训练模型。
• Harness正是承担这一职责的“组合层”。它把外部复杂环境(多文档、多工具、子智能体等)切分成模型熟悉的局部动作,使整体任务虽然超出分布(OOD),但每一次送给模型的调用都落在局部分布内(LID)。
• 因此,RHI(递归式Harness自我改进)的目标不是寻找一个万能的最优Harness,而是沉淀一套稳定的Harness原语(如工具、记忆、中间件、上下文管理),并学习如何根据任务、模型和环境的动态变化,组合这些原语。这解决了当前RHI领域的三大困境:进化什么(离散原语)、怎么进化(组合策略)、如何递归(优化器自身学习)。
三、为自进化铺路:让奖励归因成为可能
DSH的插件化架构对强化学习(尤其是Agentic RL)具有革命性意义。传统Harness进化中,修改空间是混乱的任意代码,导致奖励归因(Credit Assignment)极其困难——系统无法判断一次成功到底该归功于哪一行代码。
• DSH通过显式依赖和可逆效应,把每一次干预变成可追踪、可撤销的局部操作。优化器可以像做“反事实实验”一样:加入插件A跑一次,撤销后换成B再跑一次,从而精确估计每个插件在当前结构下的边际贡献。
• 这为DeepSeek擅长的GRPO等算法提供了理想的土壤。在Agent场景中,环境状态会因历史行为分叉,终局奖励无法直接比较;而DSH提供的稳定实验状态和清晰干预边界,让“组相对”比较得以在相似的世界里进行,使优化器能真正从经验中学习“下一次该改哪里、如何组合”。
总结而言,DSH的世界观是:放弃追求一个静态的完美Harness,转而构建一个由离散、可逆、显式依赖的插件组成的动态宇宙。在这个宇宙中,AI可以通过组合泛化应对无穷任务,并通过自我修改的闭环不断进化。这不仅是工程架构的升级,更是通向AGI的一种全新路径——从优化模型权重走向优化智能的工作结构。