即刻App年轻人的同好社区
下载
App内打开
Max_means_best
1k关注3k被关注3夸夸
海本辍学创业
前创业公司CMO、美元基金SR、模型厂小天才HR、Founder Park运营、AI PM
小红书Max For AI(4万粉
置顶
Max_means_best
2年前
“我喜欢看到欣欣向荣的世界”
​国内已经有很多创业者社群了,但 builder的社群比较少
有时候,不考虑盈利,纯粹做一个喜欢的事情也是挺不错的

————Hackathon Weekly 北京01场纪念
138
Max_means_best
1天前
早上看到 Tibo 给大家解锁了Codex的1M上下文!

但是改参数好麻烦,于是让Lobe Agent自己做了个一键配置的skill

你只需要输入npx --yes github:MaxForAI/codex-1M

然后就默认开启了1M上下文啦✌️

大家快一键配置一下给自己的Codex解锁1M上下文吧!

PS:实测Codex里只能开启到82W左右的上下文,因为还有一些Codex预留的长度。

GitHub:github.com

欢迎star和提建议哦~
00
Max_means_best
2天前
神了,居然能看到海外权威研究机构在讨论小红书的模型??

8 14 日,小红书 dots 模型实验室开源 dots3-note preview。

模型总参数 280B,每个 token 激活约 16B 参数,支持 512K 上下文,并具备文本、视觉和语音等多模态理解能力。

开源后短短几天,SemiAnalysis、vLLM、SGLang、ARC Prize 等海外 AI 社区和机构陆续开始讨论这一模型。

其中 SemiAnalysis 的测试最受讨论。

SemiAnalysis 直接以「dots3-note beats American open weight models」为题进行了比较。

原因是在 Terminal-Bench 2.1 上:
dots3-note拿到了75.1分,而其他的美国开源模型都只拿到了70分左右🫡

更值得关注的是,dots3-note 本身并不是一个单纯针对 Coding benchmark 优化的模型。

它背后的研究问题是一个目前仍然没有得到充分解决的方向:
Long-horizon Agent

也就是能够在真实世界中持续数小时、数天甚至数月执行任务的智能体。

比如现实世界中的旅行规划、装修、长期研究等任务,往往持续数天甚至数月,同时存在意图逐步披露、环境动态变化、超长 trajectory、稀疏 reward credit assignment 等问题。

为此,dots 团队引入 self-critique,让模型在任务过程中持续评价自身状态;同时提出 TEMPO,探索长程强化学习中更有效的训练方式。

团队还构建了 VibeSearchBench VibeLifeBench,专门评估多轮需求理解和动态环境下的长期任务。

值得一提的是在VibeLifeBench目前的结果中,即使最强的一批模型,在这些真实生活长程任务上的绝对得分依然很低。

这可能也是为什么 dots3-note 最近会引起海外 Agent 社区的兴趣。

而且 note 目前还只是 dots3 系列中最轻量的版本。

按照小红书公布的规划,完整 dots3 系列还包括 jazz aria。

真正值得观察的,是这套针对真实世界长程 Agent 的技术路线最终能走到什么程度。

目前dots3-note preview已经在官网免费提供
在hugging face、GitHub也已开源
10
Max_means_best
5天前
DeepSeek Harness来了!

就在刚刚, Deepseek发布了首款 Agent 产品:DeepSeek Harness(DSH)。

这是 DeepSeek 首次将产品能力从模型层进一步延伸到 Agent 执行层。

此前,DeepSeek 已在 V4 Flash 正式版更新日志中披露,官方 Benchmark 使用即将发布的 DeepSeek Harness 极简模式进行测试。如今,DeepSeek Harness 正式推出,其定位并非单纯的 Coding Agent,而是一套可配置、可重组的 Agent 运行环境。

从功能上看,DeepSeek Harness 支持项目管理、长任务执行、多 Agent 编排、上下文管理、联网搜索、Skill、第三方模型接入等能力。

其中较核心的设计包括:

Agent Preset:通过不同预设组合系统提示词、工具、Skill、上下文压缩和子 Agent 能力;
插件系统:模型、工具、策略、存储、上下文乃至 UI 均可通过插件扩展或替换;
完整事件记录:系统会保存 Agent 执行过程中的模型请求、工具调用、系统提示词及上下文变化,便于回放和重建;
多模型支持:可接入 OpenAI、Anthropic、Google、Kimi 等近 40 家模型提供方。

DeepSeek 将其插件架构概括为:Everything is a plugin。

据内测项目情况,参与测试的开发者在数天内已经开发出约 300 个插件,其中包括界面修改、长期记忆、会话管理以及 Agent 自我整理等功能。

这也意味着,DeepSeek Harness Codex 等一体化 Agent 产品的思路存在明显差异。

Codex 更强调直接交付一个完整 Agent 产品,而 DeepSeek Harness 更接近一套 Agent Runtime:开发者可以自行决定模型、工具、提示词、上下文策略、工作流和界面如何组合。

值得关注的是,DeepSeek 此前已经开始将 Harness 纳入模型评测体系。

这说明对于 DeepSeek 而言,Agent 的实际能力不再只由底层模型决定,工具、提示词、上下文组织和执行策略,也正在成为模型最终表现的一部分。

从开源模型到 Agent 执行层,DeepSeek 正在把竞争边界进一步向模型之外扩展。
10
Max_means_best
6天前
DeepSeek V4 Pro 正式版来了!

十分钟前, DeepSeek官网更新了DeepSeek V4 Pro正式版的信息!

新的模型叫DeepSeek-V4-Pro-0813🔥

价格还未发生变化

V4 Pro 0813 相比此前 Preview 基本是一次全面跃升,已经全面接近/超越Fable 5

Terminal Bench 2.1:72.1 87.9,超过 Opus 4.8 85.0,距离 Fable 5 88.0 只差 0.1。
Cybergym:52.7 83.3,超过 Opus 4.8 78.3,也略高于 Fable 5 83.1。
DeepSWE:12.8 62.7,超过 Opus 4.8 58.0。
AutomationBench:12.8 31.8,超过 Opus 4.8 27.2 Fable 5 29.1。
Agents' Last Exam:16.5 25.7,追平 Opus 4.8。

尤其夸张的是 DeepSWE,Preview 还只有 12.8,0813 已经干到 62.7。

DeepSeek 这次升级的重点是Agent。

目前已经可以通过 API 访问了
00
Max_means_best
18天前
这图神了
30
Max_means_best
18天前
突发!OpenAI宣布GPT-5.6大降价!!

OpenAI刚刚宣布,他们决定即刻起对GPT-5.6系列模型进行降价!

GPT-5.6 Luna降价80%,输入价格降至每百万Token 0.20美元,输出1.20美元。

GPT-5.6 Terra降价20%,输入价格降至2美元,输出12美元。

GPT-5.6 Sol标准价格不变,但API新增Fast mode:智能水平不变,速度最高达到标准模式的2.5倍,价格为2倍。

OpenAI还将ChatGPT和Codex CLI中的Auto-review模型从GPT-5.4升级到GPT-5.6 Luna。

结合新价格,OpenAI预计自动审阅的成本将下降约10倍。

这次更新真正值得注意的地方,是降价的原因:

GPT-5.6Sol自己优化了自己的推理,导致成本和骤降。

此前,OpenAI让GPT-5.6 Sol进入Codex,分析真实生产流量、优化负载均衡,并自主重写生产环境中的GPU内核,最终让端到端推理成本下降20%。

随后,Sol又为自己的推测解码模型设计并运行了数百次实验,使Token生成效率提高15%以上。

模型训练层面的递归自我改进还没有出现,但模型优化自身运行基础设施、再将收益转化为价格优势的商业闭环,已经跑起来了。

接下来的AI价格战,可能会由模型亲自下场打。

降完价后GPT5.6-Luna的性价比要比DeepSeek V4 Pro预览版要好了

@deepseek_ai梁叔叔你倒是发力啊😭
32
Max_means_best
20天前
现在才意识到当年秦始皇焚书坑儒是为了训模型。
20
Max_means_best
20天前
这个时代收益最高的主线只有两条:

1. 提升模型智能的边界
2. 交付更智能用户体验

其他的都是浪费时间。
00
Max_means_best
22天前
卧槽,美股半导体被中国光刻机砸盘了。。

据The Information报道,中国一家国资背景企业已经开始小批量生产国产浸没式DUV光刻机。

今年预计生产约5台,2027年增加到20台,计划交付给中芯国际、华虹和长鑫存储。

机器目前在性能、可靠性和制造质量上仍然落后于ASML,距离真正成熟还有很长一段路。

只看这几个数字,市场似乎确实反应过度了。

5台机器,性能还不如ASML,怎么可能威胁一家垄断全球高端光刻机市场几十年的公司?

但资本市场交易的是未来。

实验室里造出一台样机,只能证明技术路线勉强可行。

真正送进中芯、华虹和长鑫的生产线,经过精度、稳定性、良率和设备兼容性的长期验证,再根据客户反馈不断修改,才意味着国产光刻机开始建立完整的产业迭代闭环。

第一批机器可能很差,产量也少得可怜。

但只要能够在晶圆厂里跑起来,后面就会产生真实数据、客户反馈、供应链订单和工程师经验。

下一代机器的研发,也终于不用继续对着实验室参数闭门造车。

更关键的是,西方每收紧一次出口限制,都在替国产设备创造一个必须被使用、必须被改进的市场。

ASML短期内依然没有真正的对手。

中国国产EUV目前也还停留在原型阶段,浸没式DUV今年预计只有约5台产量。

但ASML在中国市场的垄断,已经出现了一条可以持续扩大的裂缝。

所以今天半导体跌的,并不是这5台机器对应的订单。

它跌的是一条过去只存在于新闻和PPT里的国产替代路线,第一次真正开始进入晶圆厂。

一台性能更差的机器不足以威胁ASML。

一条能够持续获得订单、数据和客户反馈的国产供应链,足以让市场重新定价。
117