即刻App年轻人的同好社区
下载
App内打开
许涵之
41关注3k被关注5夸夸
AI PM,在做一款 AI 硬件
前字节 PM,腾讯产培
公众号、小红书同名
wx:xqys_wx
置顶
许涵之
6月前
加入了一家 AI 硬件初创公司。即刻上的朋友在看机会的,一定要来考虑考虑我们这儿啊(๑>ڡ<)✌️。

公司的介绍可以看这篇小红书的帖子,我就不再赘述了。三个关键词:Always On、AI Memory、Proactive Agent。当然,都是一些比较共识的词了,但我们也有一些自己独特的思考。无论是对这份工作感兴趣,还是单纯想聊聊的朋友,都可以来找我呀,我往返北京深圳,可面基可线上。

在这条帖子下评论、私信或者加我微信都可以的~

神仙AI公司招人了!社招非校招! - 小红书

1712
许涵之
10:29
Gamma 的这个经历给我的启发就是:不要在太多的领域追求创新,收敛欲望,想清思路。

创新应该围绕我的核心理念,但在核心理念之外,其他地方应该尽可能保守。这样才能给用户搭建通畅的桥梁,让他多感受到我最核心的创新的地方。

至于其他想创新的东西,我可以等到有足够多的用户走进来之后,再去施展。
00
许涵之
00:01
Jev 的创始人说,现在很多产品想摆脱 human-in-the-loop,让产品真正自动化,但这是不可能的。因为大模型的训练方式就是对齐人类偏好,只要大模型的目标还是让人类满意,那就不可能让人摆脱 human-in-the-loop。这个观点还挺有启发性的。
23
许涵之
1天前
真的好像如@The沐秋 所说,每一次一个模型口碑爆了,好像都伴随着一个很能引起传播的、在视觉前端能力上的大幅升级:

• Kimi K3 的前端页面
• Astra 的 Computer Use、3D 模型和机械操作
• 这次又是 Opus5.5 的用 JS 直接做出堪比视频生成模型的精美动画视频

这其中有因果关系吗?是因为他们重点押注了这个,所以让他们爆了起来?还是因为他们爆了,所以更多被用户发现了这样的技能?还是说二者是相辅相成的关系?
10
许涵之
2天前
长期依赖自动驾驶的飞行员,手动判断力会退化。一旦飞机失灵了,需要人工介入的时候,他已经失去了在那几秒钟快速反应的能力。我们对 AI 的依赖也会是如此吗?
71
许涵之
4天前
之前看达里奥的访谈,首次意识到后训练具备充分的潜能,是因为后训练也可以像预训练从 GPT-1 GPT-3 那样泛化:从可验证的环境到不怎么可验证的环境,从代码到其他的人类工作任务。那时候只是获得了这样一个启发,但并没有深刻去思考为什么它可以泛化。

今天读这篇文章,好像又得到了另一种新的启发:模型从可验证任务泛化到没那么容易验证的任务,一个很大的原因可能是模型在可验证任务中学会了长时间探索并找到结果,学会了保持耐心,学会了从过程、经验和失败中学习。

而有一些任务虽然不能得到明确的结果验证,但只要在足够长的时间内、在足够发散的思维下、在足够好的行动空间内探索,答案的质量就是成正比提高的。所以对于没那么容易验证结果的任务,其实是通过可验证任务在长程任务能力上的提升,从而得到了泛化。这是 RL 能够进行泛化的一个原因。

我之前并没有意识到这个关键节点:长程任务不再只是拓展人类有效任务的领域之一,它甚至还成了一种泛化的手段和途径。

但仍然有很多任务,即便给了足够的时间和空间,也依然无法得到结果。这类任务可能就无法通过这一途径来泛化,需要去寻找其他的解法。这也是文章中仍然存在不确定性的事项之一
00
许涵之
12天前
today.ai 昨天给我推了 5 条消息,就图1 中间 Benchmark 这个有点用。

我用过那么多宣称主动式 AI 的产品,至今唯一对我有用的,就是 ChatGPT 里面已经下架的 Pulse 功能。所以我一直觉得,帮你搜,也就是帮你引入外部信息,还是相对稳妥的主动性起点。

首先,搜索本身已经是一个非常成熟的动作,这个动作本身很难出问题、很难效果不够好。主动性行为首先要考虑"触发对不对",其次还要考虑"完成对不对"。因为触发很可能已经不够准了,那完成动作就千万不要再出岔子,而搜索是最不容易出岔子的,AI 这一波浪潮首先就是把搜索搞定了。

其次,搜索是自带额外上下文的,不管怎么样至少能了解一个新鲜事。它和其他"猜你所想"相比,侵犯性是更弱的。

第三,它只是基于你已有的上下文,再去搜一个最新的上下文并将它们结合到一起,这种匹配的判断难度也更低。

所以我觉得,"帮你搜"是最佳的主动性起点。

当然,我家 bot 也反对了我。我觉得她说的也对,冒犯性最弱还是帮你搜适合作为主动性起点的核心原因,其他两点的论证都有漏洞。

BTW,不考虑泛化性和通用性,我们公司这个 bot 的主动性,其实才是我用过最好的。

我并没有 @她,我只是在群里面跟其他同事分享了我的观点。它主动来回应,才引发了我后续的思考,继而引发了她和我后续的讨论。
34
许涵之
14天前
today.ai 其实是一个和我的理念挺像的产品,只是我和他 bet 的上下文入口不一样:我相信物理世界、用户随身;它相信数字世界、工具整合。而这两个恰好是最互补的。

以及他直接强调了最宏大的概念,就是个人助手,并没有从某一个细节点切入,这也是他和我们的不同。

除了这两个地方之外,无论是从界面架构上,还是从 onboarding 体验上,我觉得都有不少值得借鉴的地方。

Onboarding 过程让人惊喜的地方在于,登录谷歌账号的时候就授权了 Gmail,在经历一些其他的 onboarding 步骤之后,它在给我的最后的 onboarding 介绍中就已经极快速地检索了我的 Gmail,表达了它对我的了解。

这个是蛮让人惊喜的,速度太快了。我刚刚才授权,只是一两分钟经历其他 onboarding 步骤的时间,它就已经能够把我的 Gmail 翻个底朝天,然后告诉我它对我有什么了解了。

这种惊喜感很强烈,在我还没结束 onboarding 的时候,就能让我快速感知和相信它懂我,这个设计得我觉得非常好。

不过继续用下去,就只能止步于此了。当然,可能还是因为我最重要的信息都在飞书和微信上。如果是一个海外工作和生活的人,可能帮助还蛮大的。
113
许涵之
15天前
我们常说 less is more,这个要求在 AI 产品上会更加剧烈。因为和非 AI 功能不一样的是,每多一个 AI 功能就要多一份效果持续调优的负担。AI 功能管生还要管养,生出来很容易,但不能好好养着最好不要生。
11
许涵之
16天前
分享一下基于这个习惯积攒的一套自进化 skill github.com

许涵之: 使用 Claude Code 级别的 AI 进行工作产出的几个经验性习惯: 1. 对 AI 的追问做出回应 Claude Code 完成任务后,有较高比例会主动提出下一步要做什么。其中 80% 都没什么用,但如果忽略它,它可能会一直提,影响它的判断。所以要回应它的这些追问,哪怕只是简单地告诉它不用做这些。 就好像我们带一个实习生一样。实习生很积极,有想法,但很多想法不对,那就要告诉他或纠正他,防止他一直沿着这种想法走偏。 2. 尽量让 AI 来修改 AI 的产出 AI 的产出,尽量让 AI 来修改,而不要自己修改。如果实在要自己修改,请告诉它你修改过,且让它读一遍,再和它进行下一步的任务。 BTW:我在 claude.md 文件中有要求:如果 Claude Code 最终的产出包含文件,请在某个我指定的默认文件夹下建一个子文件夹,把这些产出放到这个文件夹下,且 Git 初始化。每次运行任务前,检测这个文件夹有没有变动,有的话,帮我进行一次手动提交。每次完成任务后,自己进行一次手动提交,以保存我和它的所有修改,且将我和它的修改进行区分。 3. 对 Claude Code 提出修改意见时,下意识思考如何让它一步到位完成结果 对 Claude Code 提出任何修改意见时,请下意识地思考:我要怎样修改、完善我的 claude.md 和 skill.md 文件,或者请它帮我完善这两个文件,能让它一步到位地实现我的想法,而不需要我再给出这些修改意见。 4. 最重要的:将最终产出反馈给 Claude Code 如果 Claude Code 交付了成果,我最终应用了一部分,成为了我的实际产出,请把这个产出发回给 Claude Code,让它思考要怎样善 claude.md 和 skill.md ,才能更趋近于这个产出的结果。 把 Claude Code 当成一个实习生。实习生渴望成长,渴望反馈,渴望有闭环。我们要给它这个闭环,帮助它成长。 进一步地,关于第四点,特别是对于重复性工作,可以借助此让 AI 实现“自进化”。 以我的周报文档为例: 我让 AI 基于我所有的文档和消息,按照一定的格式撰写周报。它本地会留存一份它写的 MD 版本,且它会直接填充到飞书文档上。我会修改这个飞书文档的版本作为我的正式交付。等到下一周,它会首先比较它生成的原始 MD 文档版本和我最终交付的飞书文档版本,思考怎样完善它的 skill.md ,才能尽可能让它的产出无限趋近我的产出,然后基于新的 skill.md 再生成新的周报,循环往复。 我非常惊叹于 Claude Code 的自进化能力。第一周的时候,它写的周报大概只有 20% 的东西能用。这样迭代了两次,等到第三周的时候,它写的东西竟然能有 90% 的东西可以直接用了。 除此之外,还有让 AI 帮我做简历评估。每天通过 Broswer Use 拉取飞书招聘中简历待评估列表中所有它还没评估的简历,帮我自动评估是否通过,理由如何。 一开始做得不好,后来我突然联想到了周报的这个自进化过程,让它每次在评估之前,先拉取我过去所有的我最终拍板的面试评价和简历评估,以及它本地原始的简历评估,并自行思考要怎样评估才能更接近我的判断,然后它再对最新的简历进行评估,不断自进化。 包括我让 Claude Code 帮我做面前准备,通过 browser-use 拉取所有的简历、作品集、评语、附件和网站,然后帮我整理面试者的基本信息。同时,基于对我的工作的理解和岗位需求的理解,准备一些个性化的问题。 在每天读取未来的面试列表做面前准备之前,我也会让它去读一下我过去面试的转写逐字稿,看看我真的会问哪些问题。如果有些问题我问了,但它在准备时没考虑到,它应该如何调整才能更接近我真实的面试流程,从而实现自进化。 我了解到 Hermes Agent 也有自进化的概念,但它的自进化本质上是面向过程进化来优化 token 效率,而不是面向结果的。因为作为一个通用产品,它无法对结果的好坏进行评估,也就无法基于结果进行自进化。 但个人使用的话,结果好坏的置信度是非常高的,可以让 AI 基于结果来自进化。进化的载体就是 claude.md 和 skill.md。虽然这样做会导致太个性化、无法泛化,但对个人使用来说完全不是问题。 当我真正用熟这个体验后,我突然联想到这可能也是一种 continual learning。怎么联想到的呢,因为我发现这种自进化竟然也有类似灾难性遗忘的问题。我发现它为了弥合最近一段时间的简历评估结果,会导致过拟合。如果真的让它再回测之前的评估,大概会有偏离。但这些任务本身都很消耗 token,目前不太好回测。 目前对于简单的问题有比较好的解法。例如我让它做自动的 bug 优先级分类,每次分类完都会通过飞书消息发给我,我会告诉它哪些分得不合理。因为 bug 描述和分类消耗的 token 很少,所以我直接把历史数据全部存档了。当它有大的 skill 优化时,就回测一下过去所有的分类方法,保证不要过拟合到当下的 case。这有点像它同时负责评测提分和构建评测集,既当裁判又当运动员。对于简单问题来说这没什么问题,但对于复杂问题,很难让历史数据全部回归一次。目前只能依赖它自身的通用能力,配合提示词来防止过拟合。

01
许涵之
23天前
X 上已经基于这个模型玩出很多花样了,这可能是生成视频模型的另一个很重要的时刻,甚至比 seedance2.0 还要重要
20