即刻App年轻人的同好社区
下载
App内打开
Brax
224关注425被关注0夸夸
分享皆个人观点
🤡当前在 ego 捣乱
随时约咖啡☕️wx:Braxtonthefirst
Brax
3天前
我靠,巫师三重制版本更新前,我稳定140帧以上。更新之后,同样的画面设置下,我只有70帧了
00
Brax
3天前
明面上:除了真的在美国混的且有强关系网+社交能力的,能拉了一堆水下关系来帮忙在X上宣发的,真的有人可以不找这些“低质”达人吗,还有其他招吗?

暗地里:每次 perplexity 都在 tg 上找了一堆水军且没有标 paid partnership 的账号发内容
40
Brax
4天前
卖 personal agent 模版好了,方便大家改个名字换个皮就能上。
10
Brax
4天前
真正的多领域中的多任务并行感觉是伪命题啊

现在拿着 AI 同时搞多个上下文不一致的任务,大脑极其容易爆炸

人脑跟上下文窗口一样或者说上下文窗口跟人脑一样,要是往里面灌不相关的信息,那就是哪个任务都做不好

硬要搞并行处理,任务也只能是上下文高度相关的任务才能并行,才能尽可能的保证产出的质量
10
Brax
8天前
AI 太坏了,太容易沉迷给网站雕花了
00:26
00
Brax
14天前
笑死
00
Brax
15天前
一年半摸鱼训练状态记录
20
Brax
15天前
谁问你了?你就在公司大群里叭叭叭一顿输出

敖特_Aute: 同事问我对 Jev 在 Broswer use 领域的应用有什么看法? 答(一些比较初步的感受,不代表未来观点不会变): Jev 我理解是以输出通用且有限的分类为目标所训练与架构的,在类似任务下相对自回归生成结构化文本的 LLM 有很大速度优势。 目前看起来有几个限制: 第一,每次调用前需要准备好候选选项,虽然可以动态生成,但候选难以枚举或者数量太多时,就需要额外处理,常规的文本生成更不是它的适用范围; 第二,分类不是百分之百准确的,和 LLM 一样,也受限于模型规模、训练质量等影响; 所以具体到 Broswer use 这样的通用任务,我觉得还是要讨论讨论。 具体可以从两个维度分析:单次动作的可选范围,以及单次动作的推理难度。 从可选范围来看,一个页面的可交互元素,乘以每个元素的可交互方式,比如点击、输入、拖拽等,如果全部平铺,很容易把选项撑爆。Jev 目前单个 Choice 最多支持 255 个选项。把操作和目标拆开可以缓解,但某一类操作的目标仍然可能太多。 从推理难度来看,浏览器任务里有大量操作,单步推理难度是不高的。Jev 更适合的 System 1 任务,我凭感觉可能占很大比例,大多数情况下应该超过 90%。 举个例子,在网页上购物,商品、金额等都已经确认,走到结算这一步,页面上有个支付按钮,需要点它,确实就只是 System 1 难度的动作。 但换个例子,页面上有一道复杂的数学选择题,只有三个选项。这时候选谁,就无法离开 System 2 进行推理。选项少,不代表问题简单。 当然,Jev 分类这种输出形式本身不意味着没有推理能力。但 Jev 官方确实列出了多跳推理、精确数值处理等弱项。考虑到浏览器是一个通用容器,需要调动 System 2 能力的任务一定是无法避免的。 那么,选项撑爆和 System 2 介入这两个问题要如何解决? 选项撑爆 可以通过工程手段把候选分页,留出“下一页”“上一页”;也可以逐级选择,比如先选页面区域,再下钻到具体元素,最后选择操作。还可以先给候选打分,筛选后再做最终选择。这些方式可以配合使用。 System 2 介入 可以给模型一个类似“不确定”的选项,或者根据概率和置信度,让 LLM 接管。理论可行,但可靠性需要验证 另外,动作拆分的粒度也很重要。如果把鼠标操作拆成方向加步长,靠多轮交互逐步修正,点一个按钮可能要来回很多轮,不一定比 LLM 更快。 公司里应该有部分同事,包括我,是从上一个时代的 AI 公司过来的。我们当时做的很多工作,核心就是训练模型做分类,所谓的模式识别。 因此上面列出这些问题,大都在上一代模型和系统里就有一些解决思路,总体上就是先缩小候选范围,再逐级细分。我个人其实觉得这些方案并不优雅,因为分组、筛选、纠错、升级的复杂度最后还是落到了外围工程上。 相较于传统分类模型,Jev 当然有巨大进步,可以理解自然语言描述,处理运行时定义的候选,还能并行回答多个问题。但在具体任务上的表现,是否能追平专门为该任务训练的分类模型,我持怀疑态度。对于方向加步长这样的低层控制任务,我也没有看到足够的公开评测来证明它的泛化表现。 具体到 Broswer use,如果既要维护分类模型的候选空间,又要编排它和 LLM 的分工,处理不确定性、模型切换和失败恢复,这种组合,在我看来,似乎不如直接用一个速度很快的 LLM 来得优雅。 当然,架构是否优雅不优先于实际业务表现。多模型组合省下的推理时间,能不能覆盖候选处理、额外轮次和模型切换的开销,最终还是要看任务成功率、总延迟和总成本。

00
Brax
20天前
Toc 要无限拉低上手门槛到彻底无脑
00
Brax
22天前
这两天我意识到一个事情,就是模型发展到今天,对于可能 99% 的工种来说,在工具层面其实已经完全够用了。

就是说,你今天给任何一个工种一个 GPT-5.6 Sol,或者一个 Fable 5,其实已经非常够用了。甚至都不用到 Fable 5.1。Fable 5.1 当然还是会更强一点,但它相比 Fable 5 带来的提升,对很多工作来说已经没有那么大了。大概就是这个逻辑:作为一个工具,今天这些模型对于绝大多数用户来说,能力其实已经完全够用了。

现在一个人到底能把这些模型,或者配备这些模型的 Agent,发挥出多大的能力,我感觉越来越取决于产品怎么设计,也取决于用户自己怎么去用。

因为现在这个天花板,其实已经有点像木桶效应了。模型这一块已经足够长了,真正的短板反而变成了用户自己的想法。

他有没有把事情讲清楚?有没有规划清楚?他自己本来有没有想明白这件事情应该怎么做?他知不知道自己最终要什么?

很多时候,模型已经完全有能力把事情做出来了,但是前面的这些东西还是要靠人自己。

所以本质上来说,作为工具属性,今天这些模型已经可以非常完整地,甚至很多时候超出预期地帮用户完成工作。

但我这两天在用,比如 GPT-6 Astral 的时候,其实反而让我意识到一个事情。

对于我自己做增长产品的工作来说,GPT-6 Astral 并没有给我的工作带来一个特别大的新增量。

它肯定更强,这个没什么问题。

但我没有因为模型又迭代了一代,然后我的工作实际就明显完成得更好了,并没有发生这种事情。

因为增长产品里面很多真正重要的东西,比如你要判断什么值得做,你要怎么拆问题,你要怎么规划,你要怎么理解用户,这些事情其实还是取决于你自己有没有想清楚。

所以我现在的理解是,模型继续发展到下一个阶段以后,它的逻辑可能会慢慢发生变化。

以前更多还是工具逻辑,就是模型帮助现有的人扩展自己的能力边界。让你写得更快,分析得更快,搜索得更快,执行得更快。

但是当这个工具本身已经足够强以后,再继续往上提升智能,我感觉它最后一定会越来越走向取代。

就是说,它可能不再只是帮助一个人把工作做得更好,而是开始直接完成这个人的工作。

可能先替代一些任务,再替代一个岗位里面的大部分职责,最后甚至直接替代某些职业。

所以它会从一个能力增强的逻辑,慢慢走向一个替代的逻辑。

但如果最后主要是替代,我觉得这里面会有一个问题。

替代这个事情,本质上不一定会给市场带来新的增量。

比如以前一件事情需要 10 个人做,现在 3 个人加一些 Agent 就可以做完。对公司来说肯定是有价值的,因为成本降低了,效率提高了。

但如果你把尺度放大到整个市场,就会发现,它可能只是把原来已有的价值,用更低的成本重新完成了一遍。

那它有没有创造新的需求?有没有创造新的消费?有没有创造新的产业?有没有在真实世界里面多创造出一些原来不存在的东西?

这个我觉得是接下来很重要的问题。

因为现在整个 AI 行业还在继续烧很多钱。模型越来越强,算力投入越来越大,数据中心越来越多,然后市场也会因为模型智能在不断提升,就继续给更高的估值。

但最后还是会回到一个很现实的问题,就是这些额外增加的智能,最后到底对应了多少新增价值。

如果模型能力一直在涨,资本投入一直在涨,估值也一直在涨,但真实世界里面创造出来的新增价值没有以类似的速度增长,那中间这个差距其实会越来越大。

那最后就可能会出现坍塌,泡沫也可能会破。

所以我这两天越来越觉得,模型发展到现在以后,接下来真正重要的东西,可能已经不只是继续把模型做得更聪明了。

因为从工具层面来说,它其实已经很够用了。

后面真正决定这个行业还能产生多大价值的,可能是我们到底能不能找到足够多新的事情,让这些已经很强的模型去做。

如果最后大部分价值都只是替代已有工作、降低已有成本,那它当然有价值,但这个价值到底能不能支撑现在这么大的资本投入和市场预期,我觉得是值得怀疑的。
10