即刻App年轻人的同好社区
下载
App内打开
小盖fun
9关注1k被关注5夸夸
做有意思的事情。
小盖fun
5天前
硅谷AI精英,最近尤其眼红乌兰察布。

我看高盛、彭博、Wired 在讨论中国 AI 的时候,居然都提到了乌兰察布。他们说这座内蒙古的小城,正在成为中国 AI 基础设施版图里的算力重镇。

因为 AI 的竞争,归根到底就是能源的竞争。你看马斯克今年一直在提太空数据中心,其中一个很重要的原因,就是未来 AI 需要的电实在太多了,到了太空以后可以直接利用大量太阳能。

OpenAI 也一样,Sam Altman 直接说他们公司的本质是把电力转化成有用的智能。

那为什么是乌兰察布呢?

因为乌兰察布同时满足了几个条件:1)天气冷。2)电便宜。3)绿电多。4)离北京近。

我对乌兰察布很熟悉,这几年暑假总会去他们那的黄花沟转一圈。所以必须得好好写写。

这么讲吧,乌兰察布这地儿一年到头基本就俩季节,一个是冬天,一个是夏天。而且冬天极其漫长。我查了下数据,年均温度只有 4.3°C。

记得有年 9 月中旬去乌兰察布的草原玩,晚上给我冻的瑟瑟发抖。问了下朋友,他说乌兰察布一般过完十一没多久就开始准备供暖了,一直持续到第二年四月中旬,差不多有半年时间都在供暖。天气真正热起来,也就七月和八月俩月。

乌兰察布海拔大概是 1400 米,然后又刚好处在西伯利亚冷空气南下的一条通道上,北边的冷空气经过蒙古高原一路下来,所以这里不光冷,风也特别大。

冷、风又大,对于生活在乌兰察布的老百姓可能不算舒服,但对于数据中心来说,这反而全是优势。天气冷,一年大部分时间都可以利用自然冷源,降低散热成本。风大,又意味着这里有非常好的风电条件。

同样一股冷风,一边帮数据中心散热,一边还能发电。哈哈哈哈哈哈哈。

而且这里的电还便宜。

内蒙古本来就是能源大省,风电、光伏很多,煤电也非常充足。像乌兰察布,2025 年风电和光伏的发电量加起来,已经快占到全市发电量的一半。这几年风电、光伏还在继续增加。

到了 AI 数据中心这个规模,电价到底有多重要?平时我们生活中会觉得,一度电贵几分钱、便宜几分钱,好像没多少钱。但到了 GW 级数据中心,完全不是这么回事。

我给大家粗算一笔账。

假设一个园区平均负荷是 1GW,平均负荷率按照 90% 计算,一年大概消耗 78.84 亿度电。

2026 8 月,蒙西电网代理购电价格大约是 0.3234 元一度,冀北大约是 0.3857 元一度,两边只差了 6 分多钱。

但就是这 6 分多钱。78.84 亿度电算下来,一年就是大概 4.91 亿元。也就是说到了 GW 这个量级,一度电便宜几分钱,一年就是几个亿......

而且刚才说了,乌兰察布还有一个很大的优势,就是绿电特别多。

绿电简单理解,就是风电、光伏这些可再生能源发出来的电。为什么这件事对 AI 数据中心越来越重要?还是刚才那笔账,一个 1GW 的园区,一年接近 80 亿度电。如果这些电大量依靠煤电,背后的碳排放会非常夸张。

现在全球的大公司都在关注碳排放,Google、微软这些公司建设数据中心的时候,也会非常在意电力里面有多少来自风电、光伏这些清洁能源。

甚至可以预测,以后大家讨论一个模型的成本,除了 Token 的成本外,可能还会开始关注这个 Token 背后的能源消耗和碳排放。

写到这里,可能有人会追问,那宁夏中卫、新疆这些地方,电也很便宜啊。那里的风电、光伏资源甚至可能比乌兰察布还丰富。

这就要讲乌兰察布的另外一个优势了。大家如果经常坐火车,可能听过乌兰察布的城市口号,北京向西一步,就是乌兰察布。

它离北京只有大概 350 公里,高铁两个小时左右就能到。

北京本身就是国内 AI 公司、科研机构和互联网公司最密集的地方之一。你把算力继续往宁夏、新疆搬,电可能还能更便宜,土地也更多,但网络时延也会越来越高。

以前做云计算的时候,西部数据中心主要承接存储备份、离线计算这些不着急的活,慢几十毫秒根本没什么影响。大模型训练其实也一样,训练任务一旦跑起来就是几天、几周,对北京到机房这点时延并不敏感。

但现在 AI 还有越来越多的算力用在推理上。Agent 执行一个任务,中间还要不停的调用模型和各种服务。这些直接面对用户的计算,对于时延非常敏感。

这也是乌兰察布相比宁夏、新疆最重要的优势。电已经足够便宜了,同时离北京还只有几百公里。

查到一个数据,乌兰察布从 2017 年开始建设直达北京的光缆,后来又建设了第二条。公开数据里,乌兰察布到北京的网络时延可以做到 5 毫秒以内,其中一条线路大约是 4.2 毫秒。

所以乌兰察布的优势恰到好处。

往西走,宁夏、新疆的电可能还能更便宜,但离北京越来越远。往东走,距离北京更近,但电力和土地的成本又更高。

刚刚我兴奋地把这些事讲给了乌兰察布的朋友,他只问了我一句话:

这能给乌兰察布带来多少就业机会?

一时不知道怎么回答。说实话,算力中心能带来的就业机会,少之又少。
65
小盖fun
6天前
把最近追孙割和景甜热点,做什么 Skill AI 公众号都给取关了。
52
小盖fun
6天前
智谱的财报电话会信息量还是挺大的,看完之后基本上可以全盘理解国产模型的技术路线。唐杰的观点确实还是很通透。

奉上我的总结。

1、按照智谱管理层的说法,GLM-5.3 的提升全部来自后续训练。他们扩大了任务环境,把训练内容从普通 Coding 任务,扩展到更加接近专家真实工作的完整任务。

在基础架构、参数等保持一致的情况下,仅仅扩大后训练规模,端到端任务完成率提高超过 50%。

他们认为,决定模型上限的是四个因素的组合:基座规模、有效深度、训练深度、任务环境。

这四个维度的边际收益会不断变化。某个阶段后训练的空间最大,就先把后训练做深。如果后训练吃得差不多了,就再回过头扩大基座参数。

基座继续做大以后,还要考虑激活参数和有效深度之间的平衡,既不能让激活量太大拖慢推理,又要想办法增加每个 Token 实际经历的计算深度。

对于 GLM-5.3,他们的逻辑是,后训练和任务环境还有很大空间,所以先把同一个 Base 榨得更彻底。等这部分收益开始见顶,再考虑回来迭代 Base 模型。

2、所以智谱现在的节奏,并不是每发一个版本就重新训练一次 Base。

GLM-5.1、5.2、5.3,都建立在同一个大基座上。智谱会先通过中训练、后训练和任务环境,把这个 Base 的能力尽可能往上推。等这一轮的边际收益开始下降,再切到下一代更大的基座。

现在,他们判断 GLM-5 这一代的后训练已经吃掉了很大一部分空间,所以下一步会重新回到 Base Scaling。

但下一代也绝对不只是简单把总参数继续往上堆。他们想同时做三件事:

第一,把模型的总规模继续做大,抬高能力上限。
第二,控制每次推理真正激活的参数量。因为几 T 的模型如果每个 Token 都激活大量参数,那推理速度肯定会明显下降。
第三,提高有效计算深度。尝试 Loop Transformer 一类的思路,让同一批激活参数经过更多轮计算。这样不需要简单增加激活参数,也可以增加每个 Token 实际经历的计算量。

3、智谱判断,接下来模型可能会出现两条价格曲线。

第一条是,同等智能水平的模型,价格会持续下降。GLM-5.3 Flash 就是在走这条路,用更低的成本提供接近甚至超过上一代旗舰模型的能力。

第二条是,真正能打开新任务边界、明显提高任务成功率的前沿模型,仍然会有溢价,甚至价格还有继续上涨的空间。

所以,现在他们对于模型的定位非常清楚。GLM 5.3 继续探索智能的上限,主要覆盖复杂 Coding、Agent 和高价值任务。GLM-5.3 Flash 则是主打性价比,负责高频、大规模调用。

4、还听到一个有意思的指标叫算力乘数。

简单理解,就是每投入 1 元算力,最后能换回来多少 API 收入。当然,这个算力包括训练和推理两部分。

今年上半年,智谱的算力乘数同比提升了 14 倍。为什么能提高?一方面因为模型变强了,每个 Token 能承担更复杂、更高价值的任务。另一方面 Infra 效率也在提升,完成同样任务需要的成本更低。

感觉这个指标可以一针见血的表达大模型公司的竞争的第一性原理。

5、和国产芯片的结合。GLM-5.3 Flash 上线时,背后已经大规模使用国产芯片集群,6 天跑了 60 多万亿 Token。

接下来更难的是效率和成本。智谱过去半年也明显把更多精力放到了 Infra 上,重新做推理引擎和服务栈,又做了 PD 分离、量化、Layer Split、缓存和通信优化。同样的国产硬件,端到端服务性能相比最初基线提升了 3 倍,单位 Token 推理成本相比年初下降 80%。

6、智谱也毫不避讳的谈到了中国模型公司的算力约束。

他们的思路是尽量从数据、后训练、任务环境和工程效率中弥补差距。

其实这也是前两天硅谷风投 Dimension 总结的,芯片的出口管制反而逼出了国内极强的工程效率文化。

算力有限的时候,可以先 Scale 数据、后训练和任务环境。推理太贵,就继续做架构和 Infra 优化。等这些方向的收益开始下降,再回头扩大基座。

本质上仍然是刚才说的,同样的算力,怎么尽可能换来更多模型能力。

7、另外,智谱也正面回应了大模型怎么商品化的问题。

他们承认,单次 SOTA 本身很难形成长期定价权。今天 Benchmark 第一,可能几周以后就会被追上。在基础的任务上,模型之间已经没什么差距了。

但同时,模型也不会因此完全变成没有差异的商品。真正能拉开差距的,是模型迭代速度、真实任务完成率、单位智能成本,以及能不能进入客户更深的工作流。

尤其任务越长,模型之间的差距反而越容易被放大。回答一道题可能只差几分,但连续跑几个小时的软件工程任务,中间要调用工具、处理失败、重新规划,最后能不能把任务做完,差距会非常明显。

而且模型一旦进入客户的代码库、工具链和内部工作流,周围还会积累 Prompt、Agent Workflow、权限体系、评测标准和各种工程适配。这个时候换模型,也不只是换一个 API 地址,迁移成本会越来越高。

所以智谱的判断是,简单能力会越来越商品化,但真正能完成复杂任务、进入真实工作流的前沿模型,依然会有很强的差异化和定价权。

8、智谱下一步想做的,是让模型开始参与下一代模型的训练。

现在已经能看到一些早期迹象。比如通过 Model vs Model 自动生成、筛选数据,用 Agent 收集任务、搭训练环境、生成 Verifier,甚至直接参与推理系统的优化。

这些能力目前还散落在不同环节里,但方向已经非常明确。过去需要大量人工完成的数据生产、环境搭建和 Infra 优化,未来都可能逐渐交给模型。

唐杰提到,他们希望进一步把这件事贯穿整个训练流程,从 Pre-training、Mid-training Post-training,都让模型参与进来。他把这个方向叫 Fully Self-training,其实就是 OpenAI 提到的 RSI。
41
小盖fun
7天前
大部分 AI 产品的真正壁垒,是后训练。

真心推荐所有的 AI 创业者,都看看 Fireworks CEO 的对谈播客。Fireworks 这家公司,我觉得大概率会成为 OpenAI 之后,硅谷最炙手可热的创业公司之一。

周末两天,我一边 Vibe Coding,一边看他们 CEO Lin Qiao 的观点,收获非常大。尤其是她对 AI 应用怎么建立壁垒,以及为什么过了 PMF 以后要开始做后训练的思考,值得仔细咀嚼。

下面是我不成体系的手工笔记。

1、AI 应用一旦过了 PMF,都应该认真考虑下是否要做自己的专用模型。这绝对不是什么异想天开的事情。

因为 Anthropic、OpenAI 的模型实在是太贵了,调用量越大,反而可能亏的越多。

之前传统 SaaS 产品找到 PMF 以后,新增一个用户的边际成本很低。然后随着用户越来越多,研发这些固定成本被摊薄,毛利通常会越来越好。

但 AI 产品不一样。它不会出现边际成本递减的情况。每一个用户都会实实在在的消耗 Token,而这些 Token 真的都是钱啊。大家记得吧,去年 Cursor 就是那样,虽然收入一直在增长,但与此同时模型成本也在一起增长。

最后产品是你做的,用户是你找的,但赚到的钱又通过 API 费用交给了模型公司。

2、基于开源模型后训练的专用模型,可以大幅降低 AI 产品真正的任务成本。

因为一个针对具体任务做过后训练的模型,效果可以做到和最强的通用模型差不多,甚至更好,但推理成本可以下降 5 到 10 倍。

最近硅谷法律 AI 独角兽 Harvey 就做了一个很好的 Case。他们和 Fireworks 基于 Kimi K3 后训练出了 Tenet 这个专有模型,在法律类任务上,它的表现要比前沿模型好很多,而且运行成本不到前沿模型的四分之一。

很有意思的一点是,他们直接把效率放进了 Reward。完成同样任务的情况下,训练会更偏好 Token 消耗更少、工具调用更有效的轨迹。

所以后训练优化的已经不只是模型能力,还可以直接优化每完成一个任务到的成本。这直接决定一个 AI 产品能否产生规模化的利润。

3、当然,成本只是一部分考虑。更重要是,产品过了 PMF 之后,会产生大量的数据,而这些数据都是用户在真实任务里的选择和反馈,非常宝贵。和互联网上的公开数据完全不一样。

如果模型一直是别人的,这些数据的价值其实很难完全发挥出来。

你当然可以拿它们继续优化 Prompt、做 RAG、迭代产品,但更进一步,其实是得把这些反馈重新训练进模型。这样模型下一次再碰到类似任务的时候,就能知道什么样的结果更好。

4、一个基本的判断是,智能最终来自数据。今天基础模型能够训练的数据主要来自公开互联网和人工标注,只占全世界数据的一小部分。

真正大量的数据,还是在企业自己的应用和业务系统里。

比如一家法律公司的案件研究数据,或者一家医疗公司的医生搜索数据,都是非常宝贵的 Know How 数据。

所以,Fireworks 认为,AI 的未来绝对不会只剩下几个通用大模型,而是可能出现数百万个专用模型。任何一个规模大一些的 AI 应用,都会有自己的模型。

5、当然,这些公司不会从头开始训练模型,而是在开源模型的基础上进行后训练。后训练会越来越重要,好的 AI 应用公司,一定会有一支优秀的后训练团队。

因为 AI 时代,应用越来越容易复制。过去一个新产品可能需要几十个工程师、几个月才能做出来,现在几个人用几周时间就能做出一个可用版本。

应用层的实现门槛快速降低以后,公司真正独特的东西会越来越集中到自己的数据、产品判断和对用户的理解上。

后训练其实就是把这些东西写进模型里。

6、不过也不建议一开始就做后训练。

产品没过 PMF 之前,直接调用最强的通用模型,用 Prompt 和 Few-shot 把产品跑起来。这个阶段最重要的,是先验证用户到底有没有这个痛点。

如果必须接一些行业 Know How,就用 RAG,简单粗暴,把需要的数据临时塞进 Context 里。

等产品过了 PMF,开始积累大量真实用户数据,就可以做 SFT。比如你已经知道什么样的回答用户会接受,就可以把这些高质量样本拿来继续训练模型。

SFT 更适合解决这种有比较明确标准答案的问题。你希望模型以后遇到类似任务时,输出格式更稳定,行为更符合产品要求,少犯一些重复性的错误。

但再往后,很多问题其实没有标准答案。

比如两份医疗研究报告都没有明显错误,但医生就是更喜欢其中一份。两段代码都能运行,但程序员明显觉得其中一种写法更好。

这时候光靠告诉模型正确答案就不够了,因为这里根本没有唯一的正确答案。你需要告诉模型,在两个都能用的结果里,我们更喜欢哪一个。

DPO、KTO 这类 Preference Tuning 其实就是在把用户长期表现出来的偏好,训练进模型。

再往后,如果模型已经能完成任务,但在复杂任务里的成功率还不够高,就可以开始考虑 RL。

像 Coding Agent 这类任务,中间往往要连续做很多步决策。模型可能已经会写代码、会搜索资料,但它不一定知道最佳的路径。

这种任务很难提前准备大量完整的标准答案,因为真正影响结果的,是模型在整个过程中动态的选择和推理。

RL 更适合解决这类问题。先让模型自己不断尝试,再根据最后的任务结果给出 Reward。

成功的路径得到更高分,失败或者低效的路径得到更低分,模型慢慢学会哪些决策更容易把任务做成。

所以通常是先用 SFT 让模型具备基本能力,再用 RL 去提升复杂任务里的决策和执行能力。

最后还有蒸馏。比如一个很大的模型已经能很好地完成某个任务,就可以让它产生数据,再把这些能力训练到更小的模型上。

最后在这个具体任务上,可能用一个小很多的模型,也能达到接近的效果,但推理成本会低很多。

7、所以这几个东西其实对应的是不同阶段的问题。Prompt 和 RAG 解决怎么先把产品做出来,SFT 和 Preference Tuning 开始把真实用户数据写进模型,RL 再往上提升复杂任务的能力,蒸馏则把已经验证过的能力尽量做得更便宜。

林乔对 SFT 和 RL 的解释很容易理解。SFT 有点像给模型一本教材,把正确答案直接告诉它,让它学习这些答案。RL 更像让模型自己做题。

模型先尝试一种方案,然后去真实产品或者模拟环境里执行,根据结果拿到一个从 0 到 1 的 Reward。如果分数很差,就退回来尝试另一条路径,不断探索,直到找到高分方案。

8、RL 真正难的地方,不是训练算法,而是 Reward 到底怎么定义。Reward 可以直接理解成代码。先把一个好结果拆成多个评分维度,再按照公司的标准组合这些分数。

比如做招聘 Agent,可以分别评价候选人的能力、行动速度、韧性,再给这些指标不同权重。不同公司的权重和标准都不一样,这些细微差异最后就会变成模型里的产品判断。

9、Reward 设计不好,模型还会钻空子。比如要求一个 Coding 模型尽可能减少编译错误。模型最后找到的最佳方案,是一行代码都不生成。

这样确实没有任何编译错误,分数也很好,但完全没有完成真正的任务。RL 里的 Reward Hacking 很常见,所以模拟环境和评分标准必须尽量接近真正想解决的问题。

10、做后训练的时候,数据质量远比数据数量重要。单纯把大量数据扔进去,并不一定能得到好模型。

最有资格判断训练数据好不好的人,往往是产品团队,因为他们最了解用户到底需要什么。这也会让过去相对分开的产品团队和模型团队越来越融合。

11、Eval 也是一样。早期大家经常靠人看几个 Case,觉得这个答案好不好,这种方式可以启动,但最后必须把这种主观判断变成一套可以反复执行的 Eval。

Eval 可以类比成传统软件开发里的单元测试和集成测试。人的感觉需要逐步被拆成明确指标,否则模型每训练一次,都不知道究竟变好了还是变差了。

12、模型做完后训练也远远没有结束。最终还是要放进真实产品里做 A/B Test,看用户体验和产品指标到底有没有提升。

而且模型从训练环境切到线上推理环境以后,效果甚至可能变差。因为两边用的计算库、数值精度和推理优化方式不完全一样,同一个模型最后跑出来的结果也可能出现偏差。

所以 Fireworks 会特别强调训练和推理的一致性,尽量让模型上线以后,和训练时保持完全一样的表现。他们把这件事叫 Zero KLDE,目标就是避免模型明明训练得很好,一部署到线上,能力反而掉下来。

13、还有一点我很认同,以后比较模型成本,不能只看每百万 Token 多少钱。假如 A 模型每个 Token 的价格便宜一半,但完成同一个任务需要输出两倍 Token,那两者真实成本其实一样。

更合理的指标应该是每个任务的 Token Economics,也就是完成同一件事情到底花多少钱。

链接给大家分享下:

- www.youtube.com
- www.youtube.com
- www.youtube.com
04
小盖fun
7天前
周末花了点时间,把女儿小时候的画,做成了一本电子画册。放到了我的博客上。这是她长大的痕迹。
00:23
31
小盖fun
8天前
强烈建议大家搭建一个自己的个人网站。

能劝一个是一个。我强烈建议大家都搭建一个自己的个人独立网站,因为 AI 时代,这会成为自己的第二份简历。

今年年初,我花了不少力气,重新搭建了一个博客。现在回头看,我觉得这是我上半年做过最重要的事情之一。

可能有人会觉得,现在已经有微信公众号、小红书,还有各种各样的内容平台。

这些平台有现成的用户,也有推荐流量,还有必要单独搭建一个可能根本没人访问的个人网站吗?

我说一下自己的理解。

前段时间,我看到 OpenAI 一个员工已经让 Codex 帮他们招人。招聘方只需要把职位要求交给 Agent,告诉它想找一个什么样的人。

Agent 会去 LinkedIn 和互联网上搜索相关信息,找到合适的人选,整理候选人的经历,最后再尝试联系对方。

这件事给了我很大的启发。我们需要在互联网上有一个入口,让 AI 能够看到我们,了解我们。

像微信公众号以及国内很多内容平台,里面的大量内容很难被公开搜索,也很难被通用 Agent 稳定读取。

假如未来一家公司让 Agent 在互联网上寻找合适的人,而我们所有的经历、作品和思考都放在这些封闭的平台里,Agent 很可能根本找不到。

独立博客的情况会好很多。只要网站能够公开访问,做好基础的页面结构,Agent 就更容易读到里面的内容,了解我们做过什么,对什么问题感兴趣。

十年前,我也搭建过一个个人博客。那时候用的是 WordPress,基本只能选择一个现成模板,调整一下颜色、字体和页面布局。

想做一些特别的交互,或者实现一个脑子里突然冒出来的效果,还是很难。现在有了 AI,我们完全可以自由的创造。

只要有想法,大部分效果都可以慢慢Vibe Coding 出来。你看我这个博客,完全就是我从零开始 Vibe Coding的。动画、交互所有的都按照我的构想来,没有套任何一个人的模板。

最近越折腾自己的博客,越有成就感。我写了很多自己对于生活的思考,希望把这个博客当成感性内心的自留地。

也许有一天我死了,别人能在这里,看到这哥们曾经是个有趣的人,活得还挺深刻和热烈。

搭建一个博客,其实花不了多少钱。

网站本身可以通过 Vibe Coding 来完成,Codex、Claude Code、TRAE、Workbuddy 等等产品都能搞定。

然后再买一个域名。比如我的域名是 xiaogai.fun。最后部署网站的话,我用的是腾讯云的 CloudBase,一年大概两百多块。也有免费的部署服务,比如 Vercel。

很多人总觉得,要等自己足够厉害、写了足够多的文章,才有必要搭建个人博客。其实完全可以反过来。不需要一开始就想清楚这个博客要写什么,也不用考虑有多少人会看。

就像我自己,当初建成博客是冲动使然,但这半年下来,也写了不少内容。

AI 时代,独立的个人网站可以承载自己的思考,展示自己的 Vibe Coding 作品,也能让未来的 Agent 更容易发现我们。这个事情投入不大,但时间越长,价值可能越高。
3965
小盖fun
10天前
咋还有人迷信蒸馏写作风格类的 Skill。还有什么去 AI 味道的 Skill,同样啥用都没有。简直就是缘木求鱼。
00
小盖fun
12天前
感觉这事应该还是让 OpenAI 很难受。昨天我看到曾经依赖 OpenAI 模型成长起来的明星 AI 应用公司 Harvey 已经放弃 GPT 的模型,转而基于开源的 Kimi K3 构建出了自己的专有模型。

Harvey 也是近两年新兴的 AI 独角兽应用公司,估值已经超过 110 亿美元,而且近几年一直是 OpenAI 的标杆案例。

Sam Altman 特别看好 AI 在法律行业的应用,所以,从 Harvey 成立开始,OpenAI 就一直在投资 Harvey。

之前,Harvey OpenAI 的合作非常深度,两家公司曾经合作训练过法律行业的专有模型。所以看到 Harvey 居然基于 K3 发布了自己的专有模型,我就很突然。

看来 AI 模型的竞争确实已经进入到新的阶段。接下来大概率会有越来越多的垂直行业的头部公司会基于 K3 这样的开源模型训练自己的模型。

Harvey 这次的新模型就非常成功,他们联合创始人 Gabe Pereyra 写了一篇文章详细讲了具体的模型训练过程,我强烈推荐大家可以看看。

1、Harvey 新模型的底座是 Kimi K3,他们和合作伙伴 Fireworks 一起完成了后训练,目标是让模型能够更好的完成长周期法律任务。

2、后训练主要使用了三类数据,包括合成数据、公开法律数据和人类专家数据。其中,人类专家数据非常关键。

Harvey 会让人类的法律专家检查和修复 AI 生成的合成数据,确保这些训练材料真正符合专业律师的工作标准。

3、专门为后训练搭建了专门的训练环境。模型会被放进一个沙箱工作区,里面有案件材料,也有搜索、读取文档、写文件等工具。

它需要自己完成整个任务,最后把正式交付物写到磁盘里,这一次 rollout 才算结束。

4、奖励函数围绕真实的工作质量来设计。模型每完成一次任务,都会按照法律专家制定的标准逐项打分。如果所有标准全部通过,还会得到额外奖励。

5、Harvey 还把效率直接放进了奖励里。因为真正部署 Agent 的时候,成本取决于模型完成一个任务到底用了多少 Token。

所以完成同样任务的情况下,训练会更偏好推理路径更短、工具调用更高效、Token 消耗更少的轨迹。

6、Agent 能力很依赖外层的 Harness。比如并购尽调,一个任务可能要处理多达 8000 Token 的文件,单个 Agent 很容易顾不过来。

Harvey 后来加入了 RLM,让一个主 Agent 负责管理整个数据室,再把不同的研究和分析任务分给多个子 Agent。光是换成这套工作方式,任务通过率就提升到了 46.1%。

7、这次 Tenet 的后训练用了将近 150 NVIDIA B300。当然还没有结束,接下来他们计划继续扩大后训练的规模。

即便目前只用了 150 B300,新模型 Tenet 的表现已经相当出色。

LAB 长周期法律任务中,它相比基础 Kimi K3 提升了 82%,也远远超过包括 OpenAI GPT-5.6 Sol 在内的几款前沿模型。

怪不得 Harvey 要下定决心做自己的模型。

我觉得 Harvey 确实验证了一条新的路径,基于足够强的开放权重模型,再叠加行业专家数据和后训练,垂直领域的公司也有机会训练出属于自己的专业模型。

毕竟法律属于典型的高风险、低容错场景。并且 Harvey 服务的又是全球最顶级的一批律所和企业法务,所以 Harvey 都能跑通这条路的话,其他公司应该也不在话下。

我看 X 上也有不少人在问,Harvey 为什么偏偏选了 K3,而不是其他几个开源模型。答案是,K3 的效果确实更好。

Harvey 负责模型研发的一号位提到,在 K3 之前,他们其实完全没有认真考虑过开源模型。

原因很简单,法律行业对模型能力的要求太高了,连很多前沿闭源模型距离他们真正能接受的标准都还有差距,能力弱一档的开源模型自然更不会进入选择范围。

但上个月,他们惊讶的发现 K3 在法律场景的表现已经接近前沿模型,所以才开始折腾。

真心感觉 AI 的发展是不是要进入第二个阶段了。以前一家垂直行业的公司想拥有自己的模型几乎是不现实的,因为从头训练一个前沿基础模型需要巨大的算力、数据、研究团队。

但现在随着像 K3 这样的模型在能力上逐步对齐闭源模型,头部的 SaaS 公司完全可以在开源基座上把自己的 Know How 加进去,然后训练出来一个更好的垂直模型。

为什么非得训练自己的模型?其实这事逻辑非常简单。

因为用户规模足够大之后,应用公司绝对不愿意把自家的数据交给通用模型。

就像前段时间微软 CEO 纳德拉说那样,企业应该把长期积累下来的隐性知识,沉淀进自己能够控制的模型里。

否则随着越来越多业务交给外部模型完成,企业其实是在把自己的价值一点点转移给模型公司。

如果这个趋势继续下去,那我感觉接下来大模型行业的竞争可能会慢慢变成通用闭源模型和基于开源模型训练出来的专有行业模型之间的竞争。

到那个时候,OpenAI Anthropic 面对的也不只是 Kimi、DeepSeek 这些开源模型本身,而是越来越多拿着开源模型、再叠加自己数据和 Know-how 的行业公司。

对于 OpenAI、Anthropic 上的这些头部客户来说,无论是从成本还是效果角度,大家肯定是有动力训练自己的模型。

所以我现在越来越觉得,Harvey 这次只是一个开始。

接下来,制造、金融、客服、教育等等这些垂直行业里的 AI 应用公司,大概率都会沿着类似的路走,逐步减少对 OpenAI Anthropic 的依赖,转而训练自己的专有模型。
03
小盖fun
12天前
说句实话,我一直想不明白。都已经刷 X 了,为什么还要关注那么多中文 AI 博主。硅谷那么多创业者的信息不够看吗?
112
小盖fun
13天前
在飞书里用了下豆包工作,感觉有了 IM 的这些 Context 之后,Agent 的任务完成质量确实上了一个台阶。

合并飞书和豆包的思路应该是对的,豆包工作、千问办公、Workbuddy 之类的产品,是不是最终都要以ToB 为主?如果是的话,那战场之一仍然还在 IM 里。
11