即刻App年轻人的同好社区
下载
App内打开
我的兄弟叫铁马
596关注7k被关注8夸夸
前晚点LatePost记者
现互联网投资部打工人
ENTJ
内心是个超real的糙汉
我的兄弟叫铁马
2天前
向之所欣,俯仰之间,已为陈迹,犹不能不以之兴怀。
00
我的兄弟叫铁马
2天前
一直以为OpenAI是自己找到的大语言模型这个Big Bet,其实真实情况是:

早期他们也不知道做什么,于是机器人,在《刀塔 2》环境中训练的AI,语言模型都在搞,但是钱烧太狠了要搞盈利公司,开始找钱了,想把微软拉进来,比尔盖茨不想给钱,觉得机器人、游戏都没啥意思,他想要的是能跟他一起思考研究的助手。

于是OpenAI团队把手上的GPT2 攒吧攒吧,重新训了一下,原本团队是担心这种生成式AI会产生大量虚假信息,觉得安全风险很大,没想大搞来着。

结果就是为了想让比尔盖茨至少从不想投,转到中立,专门搞了个Gates Demo,去他家客厅展示了一下GPT的效果,盖茨被惊艳到了。

钱来了。

所以啊,创业者别埋头干,高质量投资人的直觉也值得听一听。
93
我的兄弟叫铁马
3天前
今天大模型训练的路子错了吗?

今年美国 5 家最大的云和 AI 公司,加起来要往数据中心和芯片里投 6600 亿到 6900 亿美元,将近去年的两倍,而个别顶尖研究员的薪酬包已接近 1 亿美元。

这么多钱和人相信的都是同一条技术路径:先拿互联网上人写的东西做预训练,再用强化学习做后训练,这条遵循 Scaling law 的路径打开了投资人的想象空间,似乎看起来是无可争议的可以带我们进入 AGI 的路子了。

但有个人说,你们都错了。

这个人是 Richard Sutton,强化学习之父,2024 年,他和导师一起拿了计算机界的诺贝尔奖,图灵奖。他的博士生 David Silver DeepMind 团队做出了打败人类最顶尖围棋选手的 AlphaGo,用的就是强化学习:先学人类棋谱,再让 AI 在封闭环境中自我对弈,赢了就给正反馈,输了就给负反馈,自我强化、自我进化。

Sutton 从上世纪 80 年代入行研究 AI,那时候今天大部分研究员还没出生。他在 Dwarkesh 的播客上这么形容自己:

我个人挺安于跟这个领域长期不同步的,可能有几十年了,因为过去偶尔会证明我是对的。我其实把自己看成一个古典派,而不是一个逆行者。

为什么他会和这些拿几百亿美元买卡的人判断截然相反?因为他真的见过过去 70 AI 走过的弯路,这条弯路上留下了许多同行的遗憾与苦涩。

2019 3 月他写了一篇《苦涩的教训》,核心观点就是:

能利用算力的通用方法最终是最有效的,而且优势巨大。

Sutton 的解释是,按摩尔定律,算力的成本一直在指数级往下掉,可是做研究的人只是盯着手里这点算力,靠往机器里塞人的经验来提高成绩。一个项目做上几年,外面的算力早翻了好几番。人的时间就那么多,花在教机器人类经验上,就没功夫去做能吃算力的方法;塞进去的经验越多,程序越复杂,越难拿算力去硬堆。

最终历史证明,教机器学会人类经验,就是打不过靠堆算力,让机器自己学会怎么解决问题。

Sutton 举的第一个例子是国际象棋。80 年代的主流做法是研究象棋本身有什么门道,把大师的棋理编进程序。1997 年赢了顶尖棋手 Kasparov 的深蓝没走这条路,它靠的是大规模搜索:从当前局面往下把每一步可能的走法、对手可能的应法一层层全算一遍,每秒算 2 亿个局面。

当时输了的人觉得,人下棋不是这样的,所以不算真正的智能。但后来学界一次次证明了,把算力和数据做大,比苦哈哈教机器学人类有效得多。

70 年代美国国防部资助过一场语音识别的比赛。当时语言学家觉得,机器要听懂人说话,就得先懂语音学:单词怎么拆成音素,人的声道是怎么发出这些音的,这些都得编进程序。另一批人直接把一大堆录音喂给机器,让它自己统计一个音后面最常跟着哪个音。后一种赢了。

图像识别也是这样。早期是人告诉机器该看什么:你去图里找尖尖的耳朵,有几根胡子等特征的动物,找到了就知道这就是猫了,但人写的规则总有覆盖不到的地方。卷积网络不写任何"猫长什么样"的规则,而是造一台有几百万个可调旋钮的机器,先随便设置旋钮,给它看一张照片,它瞎猜一个答案,猜错了,它就把旋钮往"下次更可能答猫"的方向拧一点点,旋钮拧了几百万次,最终就能认出来图上的是猫了,效果比人手工设计的好,最重要的是可规模化。

围棋比象棋晚了 20 年才被拿下。它难在棋盘太大,一盘棋几百手,每一步又有上百种下法,往后算几步就是天文数字,靠硬算根本算不完。所以做围棋程序的人比做象棋的更相信,这回只能把人的棋感教给机器了。

后来把围棋拿下的 AlphaGo,是 Sutton 的学生 Silver 带队做的,他让机器做两件事:一件是往前算,从眼前这个局面出发,试着往后走几步,看看会变成什么样。另一件是给机器加判断能力:既然局面太多算不完,就判断下这些局面中谁占上风、赢面大概多少,不用真的每个局面都下到最后。

这个判断能力以前是看人的棋谱学会的,AlphaGo 直接自己对弈几百万次,就自己锻炼出判断能力了。

Sutton 总结,能跟着算力一起变强的办法,只有搜索和学习。《苦涩的教训》的结尾是:

把我们以为自己是怎么思考的那一套造进机器,长期来看行不通。

后来许多人引用这篇文章,用来说明把算力堆上去训练大模型多么正确。Sutton 觉得这是行业对他的误读,他说:
我们往大语言模型里塞的人类知识越多,它们表现就越好,所以感觉很不错。可我预期会出现能从经验里学习的系统。到那时,这就会是苦涩的教训的又一个例子:用了人类知识的东西,最终被那些只靠经验和计算训练出来的东西取代。

他说大模型学的是人说过的话:

下一个 token 是它们该说什么、该采取什么动作,而不是它们做了之后世界会回给它们什么。它们不会对接下来发生的事感到意外。

这期播客的主持人 Dwarkesh 说预测下一个词本身怎么不算目标呢?Sutton 不同意:

那不是目标。它不改变世界。一个系统只是坐在那儿做预测,并且为自己预测得准而高兴,你没法说它有目标。
Sutton 采用的是 John McCarthy 对智能的定义:intelligence is the computational part of the ability to achieve goals in the world。在这个定义下,没有目标就没有对错,没有对错就没有东西可学,而且学习的环境得是 in the world,而不只是在互联网文本中。

接着他讲了我印象最深的一段:

与其盯着人有什么特别,不如看动物身上那套共通的东西。人是动物。我们和动物的共同之处更有意思。语言只是表面上薄薄的一层贴面。
监督学习(人先把答案标好,机器看大量带答案的例子,自己学会怎么从题目推导到答案)不发生在动物身上,这是再明显不过的事。松鼠不上学,松鼠照样能把这个世界学个明白。小孩怎么转动眼睛、甚至怎么发出声音,都没有可以模仿的对象,那些事没有示例。

前特斯拉 AI 负责人 Karpathy 也在同一档节目里批评过强化学习:

你让模型干了那么多活,可能跑了一分钟写出一大篇,最后只从结果里得到一个对或者错。这点信息细得像用吸管吸出来的。然后你拿这一个字去给整篇过程里的每一步打分,对了全部加分,错了全部减分。这简直又蠢又疯。
Karpathy 也说,这是个很烂的方法,可现在我们也没有更好的了。

不仅是 Sutton、Karpathy,Hassabis 也一直强调,AI 得有对真实世界的理解,光靠语言不够。可现实是,在笃信强化学习的那些年,DeepMind 在大语言模型上落在了 OpenAI 后面。

此前 DeepMind 靠在封闭环境中训练打游戏的 AI、下围棋的 AI,一度风光无限,但是 OpenAI 靠着一遍遍学习互联网上的数据,又开放给普通人用,点燃了更广泛人群对 AI 的热情。2022 ChatGPT 发布一个月不到,Google 内部就拉了红色警报;第二年 4 月,Google DeepMind Google Brain 合成一个团队,开始在面向 C 端用户的大语言模型上奋起直追。

今天你问 GPT 猫为什么怕水,它答得出来;你说要把猫关进洗衣机,它会告诉你这是虐待。这到底是懂猫这个实体,还是只是懂这个概念本身呢?没人有明确答案。

这期播客的博主 Dwarkesh 事后写了篇复盘,回应"死路一条"这个说法。Sutton 的逻辑是,人类写的文本是有限的,用完就没了,所以靠它走不远。Dwarkesh 说,用完就没了和走不通是两回事:

化石燃料不可再生,不等于人类文明用了它就走进了死胡同。你不可能从 1800 年的水车直接过渡到太阳能板和核聚变电站。中间非得用煤和石油这种便宜、方便、量大的过渡品不可。

人类文本对 AI 来说就是这个过渡品。

AlphaGo 先看人类棋谱起步,是超人水平;AlphaZero 不看棋谱从零开始,比它更强。Sutton 拿这个证明人类知识没用,Dwarkesh 说,这恰恰证明先靠人类知识起步、再甩掉它,是条走得通的路。AlphaGo 的那一步并没有通向死路,只是走了进步的台阶。

听完这期播客,我的感触是,Sutton 老爷子拿到了这么高的荣誉,这么大年纪还在思考今天的学术界是不是走错了路子,而深度学习之父 Hinton 现在作为全职 AI 安全吹哨人,四处演讲呼吁人们重视 AI 安全,还是挺有趣的,一位觉得这只是个学术问题,你们今天走得不太对,另一位觉得这是人类危机问题,你们再加速我们就要完蛋了。

另一个感受是,这位和 Sutton 对话的 Dwarkesh Patel,2000 年出生,20 岁还在德州大学读计算机的时候就开始做播客,今天能做到几乎 AI 圈所有核心人士都愿意坐下来和他聊几个小时,Ilya、Karpathy、Dario Amodei、Hassabis、Zuckerberg、Nadella、Musk,包括 Sutton 这样的老一辈学者,而且聊的都是非常前沿的 AI 进展,而不是什么人生故事,赚了多少钱。

人家对采访的重视程度,我觉得可以超过我见过的 99% 以上的记者:采访 DeepMind Hassabis 之前,他把 DeepMind 过去两年的论文差不多读完了,还找了十几个 AI 研究员挨个聊;采访 Ilya 之前,他自己动手写了一遍 Transformer。他给自己定的标准是,每期开录之前,把这个话题相当于一门本科课程的东西过一遍。准备的东西大部分在节目里用不上,他不在乎。他说有些同行,"感觉根本没在努力,为什么不花一两周呢?"

在这个对话访谈泛滥的时代,人生故事说得太多,关于真问题的 Hardcore 讨论太少。国内的听众如果想无门槛听 Dwarkesh 的播客,可以去《跨国串门儿计划》搜一搜,有他的中文转述。

这哥们最近自己还跑了个实验,结论是过去六年预训练的进步,大头来自数据配方的改进,而不是模型架构的改进,文章也附在了后面。可见人家是真在一线干活,才能有真思考啊。
113
我的兄弟叫铁马
5天前
我:不是婚姻,不是财富,是自洽的生活秩序和稳定的陪伴让人幸福。
我妈:可是为什么呢?你和弟弟都还没结婚,我的人生好失败。
40
我的兄弟叫铁马
5天前
40 岁之前人生都是在预训练,先把参数和数据做大,尽可能给自己多挣点算力,40 岁才能接高难度的题。
10
我的兄弟叫铁马
6天前
忍住对别人的人生指手画脚,给出建议的冲动,包括你的家人。
42
我的兄弟叫铁马
8天前
旗袍写真get 🥰
110
我的兄弟叫铁马
10天前
今天又悟到了一点,原来我一直觉得自己不会写作,是因为自己不会读书,阅读和写作是一体两面。

陆陆续续看了很多书,但我从未真正吃透过哪一本,没能自己复述出来,也没有形成自己的思维导图,很多时候只见肉不见骨,更不用谈对句子美感的把握了。

想学好写作,可能得先学会读书。推荐《如何阅读一本书》,郝明义翻译的。纵横四海也讲过链接在下面:

EP42《如何阅读一本书》:阅读的四个层次,你在哪一层?

纵横四海

60
我的兄弟叫铁马
14天前
🥰🥰🥰
140