即刻App年轻人的同好社区
下载
App内打开
饼干哥哥
55关注1k被关注0夸夸
10 年数据分析师,现在专注 AI 编程与 agent
饼干哥哥
1月前
DeepSeek Harness必装的15个插件

DeepSeek Harness开源了,先别让手头上的Codex、CC下岗,因为它跟半成品没区别。
DSH「一切皆插件」的概念还蛮酷。
实际意思是装完以后连传文件、识图的功能都没有。。。

需要啥功能、就装啥插件。
所以现阶段面向的就是开发者,使用门槛还是有的,建议普通用户先观望吧。

想玩玩用这个指令,直接给到本地 Agent:

“
帮我安装并启动 DeepSeek Harness。
项目地址:github.com/deepseek-ai/deepseek-harness
先检查环境,缺什么装什么。
然后运行 npx @deepseek-ai/dsh web 并打开网页端。
”

跑完浏览器会弹出Web UI,然后填上 DeepSeek API Key 就能用。
Key 去 platform.deepseek.com 充钱创建,也可以从设置那里自定义模型。

装完只是开始,界面纯纯空壳。
所以必装插件我列了个清单,下面可汗大点兵:

第一梯队
ModLens:识图
dsh-at-file:输入框打@引用文件
dsh-paste-input:Ctrl+V 粘贴、拖拽文件进对话框
dsh-office:读写 docx、pdf、pptx
dsh-browser-panel:内嵌浏览器,Agent操作网页
dsh-computer-use:Agent操作桌面,仅 macOS

第二梯队
safe-find-dsh-plugins:说需求自动找插件
dsh-web-ui:全家桶之任务看板、Git、手机远程、Token统计
dsh-genui:回复里渲染图表、表格、组件
dsh-turn-rewind:一键回退
dsh-message-edit:编辑已发消息、重新生成

第三梯队
dsh-agent-teams:多 Agent 干活
dsh-memory-evolve:跨会话长期记忆
dsh-llm-fallbacks:模型挂了自动切备用
dsh-feishu-bot:接飞书机器人

不止这些,这个页面(github.com/topics/dsh-plugin)目前收录了1000+插件了。
DSH 跟组装乐高一样,可玩性很高。
感觉是对标 pi,有没有人来讨论下哈哈哈哈。
10
饼干哥哥
1月前
顶级 AI 模型价格被腰斩后,会发生什么?

Grok 4.6这波跟上了 DeepSeek梁子的节奏,与 GPT-5.6 Sol 同样的能力,但价格直接腰斩。

我理解,这不是一次促销,而是长期趋势。

Epoch AI 估算,达到同等能力水平的推理成本,大约每年下降 5—10 倍。

当顶级模型足够便宜,第一件事不是大家少花钱。

而是开始挥霍智能。

以前一次问答,未来可以是十个 Agent 并行。
以前人工抽查,未来可以让三个模型相互审核。

廉价的不是AI,而是可调用的判断力
——从“谁最聪明”,变成“一个任务到底多少钱、跑多久、失败几次”。

因为 token 单价低,不代表最终任务成本低。Agent 会循环、重试、读取长上下文,甚至持续工作几个小时。

最后很可能出现杰文斯悖论:

每个 token 越便宜,企业消耗的 token 反而越多。模型公司降价后,不一定少赚钱,反而会释放出过去根本不成立的新需求。

对 AI 产品来说,很多原本只能做一次性交付的功能,会升级成持续监控、自动复盘、主动执行的长期服务。产品竞争也会从“生成一个结果”,变成“持续把事情做到达标”。

AI 成为基建,不是因为它无所不能。

而是因为它便宜到,可以被浪费。
00
饼干哥哥
2月前
Codex 必改的8 个基础配置
我是饼干哥哥,我给NGS每人配了200美金的Codex Pro。
结果上周团队有人跟我说:
Codex不如豆包好用,离了他一点活都干不了!!

我大为震撼,明明同一套餐,另一边已经蹬疯了。。
我把两边的设置拉出来一对比,不是Codex 的问题,是这8个配置没动,大家自查!

01 权限模式
点设置 → 常规 → 权限 → 打开完全访问权限。
默认权限每次改文件都要问一遍,平时我都无脑开最大权限,省得被弹窗打断。

02 个性化
点开左下角设置,找到个性化。
语气从默认"亲和"改成"务实",少说废话;
记忆功能打开,记住用户偏好;
自定义指令上GitHub搜"forrestchang/andrej-karpathy-skills",卡帕西吐槽Agent写的那份开源规则,整段复制粘贴进去就行。

03 跟进行为
点开左下角设置,找到常规。
编辑器下面把默认的"排队"切成"引导";
任务跑到一半能随时插话纠错,不用等跑完再返工。

04 会话管理
会话卡死、上下文太长没救了。
右键任务"复制会话ID",给到另一个对话框继续改;
如果是背景全但想另开路线,选"在新任务中继续"。

05 电脑操控
设置里找"电脑操控",打开"任意应用"和Google Chrome这两栏;
日常操作App、刷网页,让 Codex 爽玩你的电脑。

06 搜索任务
任务多了翻不到,点左侧边栏上方搜索图标🔍
弹出面板直接搜任务,比翻列表快。

07 语音听写
设置里点"语音",设好快捷键;
随时随地开始口喷,自动转中文,比打字都快。

08 重连接问题
如果总遇到"正在重新连接5/5"这问题,是Codex想走WebSocket,代理不支持就反复重连。

先把下面提示词丢给Codex修复:
“
请帮我修复"重连接"问题:
备份config.toml为config.toml.bak,新增provider(名openai_http,wire_api=responses,supports_websockets=false,requires_openai_auth=true,已有同名则跳过),顶部model_provider改成openai_http,完成后告诉我改了什么。
”

如果还卡,还有个方法:

“
帮我检测本地代理端口,先检查.codex/.env是否已存在并备份现有内容,查到端口就更新或追加代理这两行,不要整体覆盖;
查不到再问我;完成后告诉我具体改了什么、端口怎么确定的。
”
然后重启就 ok 了。

(* 改完如果发现会话变少了,是按 provider 分组的正常现象,改回去就行了。)
22
饼干哥哥
2月前
真的看不懂高铁的售票逻辑
我自己一个人出行
上车的时候,诺大的车厢空无一人
庆幸可以以 1 个人坐的时候
就上来一位乘客,非常精准的坐到了我的旁边
不是,这么多位置,为什么要匹配我啊?
整个车厢就我们俩,这合理吗?
21
饼干哥哥
2月前
如何给传统网站加上 Agent,让 AI 操作一切

上一篇提到我在做的 ngsFlow,要加一个 Canvas Agent 操作画布的踩坑经验。

现在跑出来了,关键在网站要把自己的业务能力整理成一套 Agent 可以理解和调用的产品协议。

如果你也在经营网站,想让 Codex 帮你加一个 Agent 让 AI 替用户操作功能,可以参考提示词:

```text
请分析当前网站代码库,并设计一套让 Agent 深度操作网站功能的改造方案。

要求:

1. 不替换现有业务流程、数据库、API 和任务系统,Agent 只作为旁路编排层。
2. 梳理网站现有核心能力,建立统一 Capability Catalog,避免在不同页面、CLI、MCP 中重复维护工具定义。
3. Agent 每次先读取当前页面和项目状态,再生成声明式执行计划。
4. 所有写操作必须支持 dry-run、变更预览、一次确认、原子提交、版本冲突检测和撤销。
5. 付费、删除、覆盖、发布、本地命令等操作增加独立审批和预算限制。
6. 长任务使用持久化 Run/Job 状态,不依赖一个长 HTTP 请求。
7. 执行完成后必须通过确定性条件验证,不能仅凭模型回复判断成功。
8. 建立统一 Trace,记录 run、turn、tool、审批、耗时、结果、失败原因和敏感信息脱敏。
9. 全局 Agent UI 可以常驻,但会话、权限和上下文必须按用户、项目和页面隔离。
10. 保持旧功能和旧客户端兼容,给出分阶段实施方案、公共接口、数据表、核心类型、测试计划和回滚策略。

请先进行只读代码审计,再输出:
- 当前架构与主要问题
- 目标架构图
- 分阶段改造计划
- 需要新增或修改的模块
- 风险与兼容策略
- 可验证的验收标准

不要直接大规模重写代码,优先复用现有业务能力和任务系统。
```

协议整理好之后,接入方随便换:网页侧栏 Agent、本地 Codex / Claude Code 走 CLI 和 MCP 都能用
00
饼干哥哥
3月前
复盘一个典型的 Agent Harness 问题

上篇讲到我在开发 ngsFlow AI画布,有个 Canvas Agent 可以帮用户直接搭工作流。但结果很尴尬:它只能稳定完成 3 个节点左右的简单连线,一旦涉及复杂需求,就开始漏节点、连错线、做到一半停下来说"完成了"。

后来专门去读了 Anthropic、OpenAI 的公开实践分享,才发现这是个典型的 Agent Harness 问题。(可以直接拉到文末看解决方案)

Harness 不是模型,而是模型外面的整套执行环境:
Agent 怎么理解产品状态,怎么选择工具,怎么规划步骤,怎么安全执行,怎么验证结果,失败之后怎么恢复。

MCP 解决的是“怎么接进来”,CLI 解决的是“怎么调用”。
但它们都不保证 Agent 能完成复杂任务。

具体到 ngsFlow,问题有三个。
第一,工具重叠严重:多个工具都能建节点,Agent 每一步都要先纠结用哪个,工具越多选择越差。
第二,Agent 要自己管理节点 UUID、自己算坐标、自己维持十几步调用之间的状态,这些恰恰是模型最不擅长的。
第三,没有验证环节,工具调用返回成功,Agent 就认为任务完成了,至于画布上是不是真的有 10 个节点,没人检查。

怎么破?大厂的解法可以总结成 5 个点:

1. 收敛成少量高层工具。
Anthropic 明确说过,把产品 API 原样包成几十个工具是常见错误。应该提供面向完整工作流的工具,比如"创建一条生成流程",内部的多次操作由产品自己完成。原子工具留在底层,不默认暴露给模型。

2. 让 Agent 提交声明式 Plan,而不是几十次离散调用。

Agent 只需要描述要创建哪些节点、怎么连接、布局目标和完成条件。真实 ID、坐标计算、批量循环和事务提交,都交给确定性的 Runtime。

3. 确认粒度提到计划级。

不要每建一个节点弹一次确认。先 dry-run 展示完整预览和预计费用,用户确认一次,然后原子执行。否则长任务天然被切碎。

4. 复杂批处理交给受限 Code Mode。

创建 10 个节点、批量连线这类任务,让 Agent 在沙箱里调用领域 SDK 写循环,通常比连续调用十几次 MCP 更稳定。

5. 强制验证。

Plan 里内置后置条件:节点数量对不对、有没有断线、有没有重叠。执行完由 Runtime 重新读取状态逐条检查,不通过就进入修复循环,通过才算完成。MCP-Atlas 基准显示,大量失败发生在工具全部调用成功之后——模型提前停了。

一句话概括这套 Harness 的思路:模型负责决定要什么,Runtime 负责保证做对。
00
饼干哥哥
3月前
小龙虾,终究只是南柯一梦。

不敢说小龙虾已死。要不然又会有人来骂我制造焦虑了。

但事实上,我身边的圈子都已经没人再提了。

取而代之的,是各种「work」产品:workbuddy、kimi work,qoderwork,还有什么 work?

最近一直在思考,变与不变的边界在哪里?但我觉得一切在应用层上投机取巧的产品,都会被大模型级别的超级产品杀死。

例如 codex

所以我选择一步到位,给团队所有人装上了 Codex,有的甚至配上 MacOS,直接操作一切

例如 结合飞书cli 做各种表格文档,甚至搭建多维表格工作流,结合即梦cli 跑 TikTok 视频

接下来所有知名产品都会有 cli作为 Agent 入口。Codex 的生态就能野蛮生长了。

美中不足的是,codex 还没有 ChatGPT 的知识和逻辑推理能力。

但很快 chatpgt 和 codex 会合并,变成超级应用后,一大批做中间管道的产品又会死掉。

而这一切,从 openclaw 过年兴起火出圈至今弥留之际,不过短短 3 个月
21
饼干哥哥
3月前
ChatGPT Ads:AI 入口开始变成广告入口

最近一直在看新的海外营销渠道,毕竟我们 NGS 自己就在给跨境品牌做 Reddit

目前我比较看好的两个方向:Reddit Ads 和 ChatGPT Ads。最近问的人明显变多,甚至有朋友说,后台从 ChatGPT 过来的订单比例翻倍了。

再研究,我发现 AI 入口出现后,广告逻辑开始变了。

用户买东西前,他可能直接打开 ChatGPT,问一句:
300 美金以内买什么耳机?
露营用便携电源怎么选?
某两个品牌哪个更适合我?
有什么比 Dyson 更便宜的替代品?

所以 ChatGPT Ads 真正值得关注的地方,是它把广告位放进了用户做决定的过程中。

这和搜索广告不一样。

搜索广告等用户把需求变成关键词。ChatGPT Ads 看的是用户正在聊什么、比较什么、犹豫什么。需求还没完全变成搜索词,广告已经有机会出现。

这也是为什么我觉得它会影响跨境电商投放。尤其是那些需要研究、需要比较、客单价又不低的品类,比如 3C、智能硬件、户外装备、家居小电器、功能型 DTC 产品。

低价冲动品可能还是更适合 TikTok 和 Meta。但如果用户买前会反复问参数、场景、替代品、性价比,ChatGPT 就会变成一个很重要的中间入口。

从目前看到的数据看,这个渠道还早,但已经不是纯概念。

根据《ChatGPT Ads 出海白皮书》,ChatGPT 周活约 9 亿,日均提问量超过 25 亿。广告上线约六周,年化广告收入已经接近 1 亿美元量级。
ChatGPT Ads 的合理 CTR 区间大约在 1.5% 到 6%

行业差异也很明显。

AI 工具 / SaaS 的 CTR 大约 5.4%,CPC 约 1.1 美元;
内容和效率类应用 CTR 约 5.1%;
3C / 智能硬件 CTR 约 2.9%,CPC 约 1.9 美元;
流量加权综合大约是 4.0% CTR、1.6 美元 CPC

再对比一下其他数据。

同样是 AI 对话内广告,ChatGPT Ads 的 CTR 约 3.99%,普通 Chatbot 广告约 0.40%,差不多是 10 倍。CPC 虽然也更高,大约 1.6 美元 vs 0.8 美元,但这里看的不是便宜点击,而是有效点击。

便宜流量不稀缺,能进入真实决策链路的流量才稀缺。很多渠道的问题是点击很多,但用户没有带着问题进来。ChatGPT 反过来,用户先把问题说清楚,广告才有机会出现。

当然,这个渠道还在非常早期。数据样本有限,很多结论只能当方向看,不能直接当稳定 ROI。

但我觉得,越是早期,越值得关注它的广告逻辑变化

下一篇我再专门讲:ChatGPT Ads 现在真正的问题出在哪,以及如果跨境品牌想测试,应该怎么避坑、怎么搭归因、怎么判断它到底有没有带来增量
01
饼干哥哥
3月前
现代 AI 产品开发三件套:GUI、CLI、飞书。
最近一直在开发一个 AI 视频产品。

形式上是 ComfyUI 的自由画布 + n8n 的工作流思维,既能灵活组合各种素材,适配不同的视频需求,又加入了变量系统,去解决批量生成、批量测试这些工作流场景。

开发过程中,我一直在思考一个问题:

还需要 UI 吗?

因为同样的功能,Agent 完全可以直接跑了。

迭代到现在,我的答案是:还是得有。

而且,我越来越觉得,AI 时代的产品,应该同时具备三种形态。

第一,是 Web UI。

很多人觉得,有了 Agent,页面就没意义了。

但实际上,页面最大的价值已经不是点按钮了。

一方面,它降低了使用门槛,可视化操作更容易激发灵感,尤其是画布这种东西,很多时候不是你规划出来的,而是拖着拖着就有了新的想法。

另一方面,它更像一个个人 AI 数据中心。

所有生成过的视频、图片、提示词、工作流、变量、历史记录,都沉淀在这里,而不是散落在一个个聊天窗口里。

第二,是 CLI。

我把页面上的所有能力,都做成了 MCP,打包成 cli

除了给页面内置的 Agent 调用之外,本地的 Claude Code、Codex 都可以直接调用。

甚至还能反过来,让本地的 Codex 来操作网页上的画布、节点、工作流。

第三,是飞书。

这是我考虑移动端之后想到的。

怎么才能随时随地用到自己的产品?

做 App,前期完全没必要。

做移动端网页,体验又很蠢。

最后想到,直接在飞书聊天框里操作不就行了吗?

借鉴了张咋啦用飞书操作 Claude Code 的思路,我直接把页面上的能力全部桥接进去。

以后发一句话,就能生成视频、修改工作流、查询素材、调用 Agent。

飞书本身,就成了移动端。

而这三个入口,其实是互补的。

平时直接找 Agent 干活,最大的缺点就是过程看不到,生成的文件也很乱,过几天自己都找不到。

所以,不管是 CLI,还是飞书,最终所有结果都会回流到 Web UI。

视频、提示词、工作流、运行记录、变量、素材,全都自动沉淀进去。

Web UI 负责沉淀数据。

CLI 负责高效率。

飞书负责随时随地。

三者共用同一套能力、同一套数据。

这下就闭环了。

大家觉得靠谱吗?
01
饼干哥哥
3月前
开源 skill: 一句话把图片转成可编辑pptx
昨天开源了把图片转成 psd 的 skill
我把GPT-image-2生成PSD的能力打包成了Skill,免费开源

评论区就有同学问 ppt可以吗?
可以!
甚至一句话就让 codex 把图片拆成 57 个可编辑节点的 pptx文件(图一)
经过一晚的打磨,现在开源出来了
依然放在 bggg-skills下
github.com

叫 bggg-creator-image2ppt,支持把 png/jpeg 图、以及 html、svg格式的 ppt 图转成 pptx 文件。

逻辑跟 image2psd 类似,同样要用到 codex 的 imagegen 能力,复刻组件图片后,再重新组成可编辑文件, 但对文本框等的识别要好很多。

欢迎 stars 支持👏

这个 skill 对于日常要做分享的人来说非常有用,例如我自己现在ppt页面都是 nano banana 跑的,跑完手动再贴进 pptx文件里, 但要是遇到有问题的、或者要改个标题啥的,就要重跑,很麻烦。

现在有这个skill 后,直接局部改一下就完事了。

问为什么不让 codex 直接生成 pptx呢?
因为这样的想象力大大受限了,只能按以前代码的方式去跑一些固定模板、老套版式

现在等于整个做 ppt 的逻辑都变了,先用image2 放大想象力做漂亮 ppt 页面,再转成 pptx处理细节

感兴趣的都可以去跑一下,目前仅支持 codex里用。

总之,对codex➕imagegen 潜力的开发还在持续。。。
00