即刻App年轻人的同好社区
下载
App内打开
歸藏
567关注28k被关注51夸夸
产品设计师、模型设计师、 不会代码的独立开发者。
关注人工智能、LLM 、 Stable Diffusion 和设计。
歸藏
11:06
这个 Midjourney 的代码真不错呀!

暖色比较多,而且比较亮,同时还有点厚涂的感觉,感觉很阳光

--sref 2698223612 --profile e6wl24r
00
歸藏
10:52
OpenAI 宣布在 11 12 号以后,就无法在 Cursor 里面使用 OpenAI 的模型了。

原因是因为 Cursor SpaceX 收购以后,OpenAI 觉得可能会有人在 Cursor 里面用 OpenAI 的模型进行蒸馏。

鉴于马斯克旗下公司之前违反合同的一些经验,OpenAI 决定取消 Cursor 的模型访问权限。

Sam 和老马真是可以的。
11
歸藏
01:29
Vercel推出了一个叫 vgpu 的 WebGPU 库。它的核心是为 AI 智能体设计的一套着色器,既能在浏览器里交互运行,也可以在 Node.js 环境里运行。

它把 WGSL 着色器当作 TypeScript 处理,支持像模块一样导入导出,在打包时具有非常好的扩展性。

而且它在安装和使用时,提供了提示词、CLI、SDK、MCP 等多种方式,去告诉 AI 智能体怎么使用。

我把前几天用智谱 GLM-5.3-Flash 做的那个案例用 vgpu 优化了一下,加了很多细节,比如投影、模糊,以及自定义参数的配置。

vgpu.sh
07
歸藏
2天前
测了一下 Ox-Alpha (GLM-5.3 Flash),太牛了!

远低于 V4 Flash 的价格,完爆 V4 Flash Vision 的能力,新的斩杀线来了。

整体能力我感觉和 V4 Pro 差不多,但如果算上审美、前端表现以及多模态能力,我觉得要比 V4 Pro 强很多。

在实际场景下我主要做了三个测试:

1. 无提示海报复刻前端 给它一张海报,不给任何提示,让它用前端去复刻。这基本考验的是 WebGL Three.js 3D 渲染能力。

它一次性就搞定了,效果非常好,跟 Fable 5 搞出来的差不多(Fable 5 稍微好一点点)。而在这一项里,DeepSeek V4 Flash Vision EXP 表现非常拉胯。

2. 视频还原网站交互与 3D 渲染:

给它一段视频,让它还原整个网站的交互和核心 3D 渲染部分。第一次生成基本就差不多了,只是玻璃的方向有点问题;提醒了一句之后就顺利搞定,效果极好。

玻璃的颜色非常取决于环境光,没有环境光的话参数再怎么调都调不好,它自己想到了这一步,做得非常出色。

3. 基于海报制作视差滚动网页:

给它一张海报,让它做一个视差滚动的网页,效果也巨好。它自己做了一些发挥,把海报中的元素拆出来做成了纵向滚动网页,体素会不断往下掉,视觉上非常漂亮。

不管是从综合表现还是价格维度来看,GLM-5.3 Falsh哪怕比涨价后的 DeepSeek V4 Flash 都要更便宜,算上限时折扣的话几乎等于免费。

模型的价格决定了 AI 的渗透率能提升多少。我们现在非常需要这种价格极低、能力处于中档水平的模型,以此来提高渗透率,让更多人能用上 Agent。

从这个角度来说,这个模型非常优秀,直接把模型的斩杀线往前推了一大步
00:39
1010
歸藏
3天前
Codepilot 0.67.10 更新了,本次更新内容:

优化了模型选择器(现在可以收藏对应的模型和渠道)

修改了右侧边栏的交互:

支持打开文件树、看板;同时内置浏览器升级为真正的浏览器,不仅能访问外部网页,还可以把需要的 Tab 固定在上面

Windows 端支持自动更新与增量更新

支持了 GLM 5.3 Flash

github.com
00
歸藏
4天前
OpenAI 发布了他们自研的芯片,而且直接击败了英伟达、AMD 和谷歌所有可比可测芯片的推理 ASIC。

感觉 AI 领域的竞争已经到了下一个阶段: 现在大家除了拼模型能力以外,也在拼成本以及整个供应链的整合。

这款芯片专为大语言模型推理从零设计,从 2024 年中开始设计到流片只用了 16 个月。

它是通用的推理芯片,并非只能跑 OpenAI 自己的模型。在文章展示中,他们测试了 DeepSeek R1 以及 Kimi 2.5 的推理效率,可以跑各种模型和工作负载,甚至能跑 Doom 游戏。

目前该芯片只有工程样品,量产爬坡会在 2027 年开始,大部分产能预计在明年年底铺开。

这款芯片专门针对每瓦性能(能效比)进行设计。因为当前数据中心的核心瓶颈是电力,而非预算或占地面积,所以它必须在极低功耗下实现尽可能高的推理效率。

它的每瓦吞吐量全面碾压英伟达的 Blackwell,甚至超过了采用 HBM4 Rubin:

DeepSeek R1 超过 700 token/s/用户
GPT OSS 超过 1400 token/s/用户
Kimi 2.5 接近 700 token/s/用户

值得一提的是,OpenAI 尚未发布的 Astra AI 模型也深度参与了这款芯片的设计,这或许是它拥有极高能效且开发周期极短的关键原因。

芯片团队通过 Codex GPT Astro,在两个月内把三个原本不在生产计划内的开源模型优化到了最高性能;AI 生成的部分模块比人类专家编写的模块还要快 1.5 1.8 倍。

颇具讽刺意味的是,跑在英伟达 GPU 上的 OpenAI 模型,正在帮助设计旨在击破英伟达 CUDA 护城河的芯片。

OpenAI 的下一个目标是达到 100MW 的部署规模,并计划于今年年底开始在自家的基础设施中正式部署该芯片。
34
歸藏
4天前
试了一下字节刚发布的“豆包工作”,非常豪横,上来就先送一个月的标准会员;

如果你已经买了会员,也会免费顺延一个月,可以说是雨露均沾。

豆包确实早就应该单独推出一个面向工作场景(或者说泛工作场景,包括一些 coding)的客户端。

因为大家对豆包 App 原本的认知已经固化了,觉得它就是一个用来解决日常问题、快速完成简单任务的工具。

我觉得这次的核心优势在于,字节在办公场景下有“飞书”这个杀手锏。飞书在 AI 基建和 AI 能力适配方面一直是国内最好的办公工具之一,我自己每天也都在用它处理会议纪要等工作。

豆包工作切入办公场景,尤其是跟飞书结合后,带来了很多独一无二的体验:

首先是获取完整上下文:飞书里的所有上下文都能被豆包获取。它可以帮你管理群聊信息、会议纪要和文档,提醒你今天该做什么、遗漏了什么,甚至帮你操作日历、建群拉人,把占去大量时间的琐事全包揽下来。

然后是专属知识库:很多人的会议纪要和文档都沉淀在飞书里,这自然而然就成了个人或团队的知识库,豆包可以直接基于这些完备的上下文进行创作。

我之前就说过,上下文越多的地方效果越好;有时候一个普通模型搭配完备的上下文,效果远好于没有上下文的高级模型。

推动组织 AI Native 化转型:在接入公司内部数据后,豆包可以用来搭建看板、做数据处理,直接从多维表格等数据源拉取数据,让整个公司在组织 AI Native 化的进程上大幅提速

豆包工作基本上有现在 Agent 的所有常见能力。

通用 Agent 能力: 具备文档、表格、PPT 的生成能力,以及网页和应用的搭建与生成能力,同时也支持浏览器和 Computer Use。

丰富的 MCP(连接器)生态: 可以连接到各种地方获取上下文,比如飞书、Notion,以及国内各行业的连接器(涵盖法律、新媒体、出行、编程、学术,甚至学生场景)。内置了各种行业的 skill MCP,不用到处去找,直接选合适的用就行。

针对 Windows 场景的优化与云电脑协同: Computer Use 重点优化了国内办公最普及的 Windows 系统。同时云电脑功能也很顺滑,云端对本地的控制以及手机、云电脑和豆包 App 之间的协同非常流畅,能快速同步和控制。
网页生成与局部修改: 右侧生成的网页支持快速、方便地选定位置进行微调、标注和局部修改,用户体验很好。

这里领会员 doubao.com/work
1812
歸藏
4天前
有意思,Codex 5 小时限制回来了,但是只针对 Plus 用户生效。

根据 Tibo 的解释,这主要是因为:

1. 5 小时限制可以帮 OpenAI 平衡负载
2. 他们的额度很少,这样可以防止 Plus 用户不小心一下用完自己整周的额度,导致很沮丧

Pro 用户无论是 100 美元还是 200 美元,都不会有 5 小时的限制
103
歸藏
6天前
Ox Alpha 多模态和代码能力真的牛皮

给了他一张图片,让他用 WebGL 还原这个网页。

他真的做出来了这种 3D 玻璃材质的质感和透视,非常清晰。

最牛逼的是,我如果不是拿原图跟这个图片对比的话,我都以为它是直接把原图垫在下面,只有一些字体上的区别,然后文字的位置、排版细节都是一样的
96
歸藏
7天前
AI 硬件的付费点应该是让用户付费拿到自己用硬件获得的上下文,而不是反过来。

最近这个 AI 硬件反正出的越来越多了,但是大家的思路好像都没有转变过来。

还是收钱是为了让用户把数据留在自己这,把上下文留在这自己这。

但是我最近用的最多的 AI 硬件反倒是飞书的那个录音豆。

用的最多的原因是它可以通过飞书的 CLI 把我的所有的录音的转的文字全部拉到我的上下文本地那边。

Agent 集中化以及模型价格频繁变化的这个时间点。

你不能不可能通过让用户付费购买你的模型服务和 Agent 来绑住用户。

反倒是如果你能提供更丰富的 Agent 或者 Skill 帮助用户将这些多获得的上下文给到他自己的用的 Agent 上,价值会更大。
29