这条帖子已经 900 多个赞了,我越来越相信自然且充分的上下文环境对 AI 产品智能上限的提升作用,这就是例子之一。
我在生活中实践,也在工作中参与。提升 AI 产品的智能上限,来自于两个东西:一个是模型本身的不断迭代,一个是制造更好的上下文环境。
模型的迭代我大概率参与不了,也缺乏兴趣。但我相信做一个好的 AI 产品,给模型更好的上下文,这是我的热情所在,也是我坚信的东西。
这个上下文不是用户吐出来的那几百个提示词,而是通过构造一种环境,让模型天然获取用户的信息。
首先,一个前提假设是:没有产品的能获取用户全部的上下文,除了Claude Code 这种 bug 级的产品及其之上构建的生态,暂且不表。
现在不同的产品在 bet 不同类型的上下文:有的做桌面记忆,通过持续录屏获取桌面上下文;有的做 AI IM,获取工作或生活中的 IM 上下文;有的做 SaaS 和企业知识库,等等等等。
但我觉得一个用户每天说过的话和听到的话,是所有可获取的上下文里 ROI 最高的。
为什么 ROI 最高?首先处理方式极其成熟,就是 ASR 和说话人分离。任何人做音频产品,稍微努努力,ASR 都不会做太差的。用成熟的商业化方案,加可控的个性化适配,做不到绝对第一名,但保持在 T0 档位是有可能的——这是物理限制决定的。成本可控,效果可控。
但信息含量极高。你想想,你每天的桌面、IM、邮箱、企业软件,有一个比你每天说过的话和听到的话信息含量更高吗?
如果再带上视频,确实信息含量会更高。但语音加视频比纯语音所带来的信息增量,远远低于要处理这些视频的成本,无论是续航的成本还是模型的成本。
处理成本低,信息质量高,收集成本低,可挖掘程度高——这是性价比最高的上下文。
基于这个上下文,构建对用户的长期记忆和理解,帮用户完成任务。这种方式一定能诞生一个百亿估值的公司或部门。当然有可能不是我们,但这个赛道一定会有成功的出现。
这是我所相信的事情,也欢迎感兴趣的同学来参与。我们现在急招 Agent 工程师和后端工程师,可以直接评论或私信我,或签名档加我微信。