即刻App年轻人的同好社区
下载
App内打开
歸藏
567关注28k被关注51夸夸
产品设计师、模型设计师、 不会代码的独立开发者。
关注人工智能、LLM 、 Stable Diffusion 和设计。
歸藏
1天前
做个 Skill,帮大家分享自己拍的古建筑和国风场景。

迭代一下这几天发。
30
歸藏
1天前
兄弟们得抓紧蹬了,明天有可能还会重置。
64
歸藏
1天前
这个 Midjourney 的代码真不错呀!

暖色比较多,而且比较亮,同时还有点厚涂的感觉,感觉很阳光

--sref 2698223612 --profile e6wl24r
02
歸藏
1天前
OpenAI 宣布在 11 12 号以后,就无法在 Cursor 里面使用 OpenAI 的模型了。

原因是因为 Cursor SpaceX 收购以后,OpenAI 觉得可能会有人在 Cursor 里面用 OpenAI 的模型进行蒸馏。

鉴于马斯克旗下公司之前违反合同的一些经验,OpenAI 决定取消 Cursor 的模型访问权限。

Sam 和老马真是可以的。
22
歸藏
2天前
Vercel推出了一个叫 vgpu 的 WebGPU 库。它的核心是为 AI 智能体设计的一套着色器,既能在浏览器里交互运行,也可以在 Node.js 环境里运行。

它把 WGSL 着色器当作 TypeScript 处理,支持像模块一样导入导出,在打包时具有非常好的扩展性。

而且它在安装和使用时,提供了提示词、CLI、SDK、MCP 等多种方式,去告诉 AI 智能体怎么使用。

我把前几天用智谱 GLM-5.3-Flash 做的那个案例用 vgpu 优化了一下,加了很多细节,比如投影、模糊,以及自定义参数的配置。

vgpu.sh
09
歸藏
3天前
测了一下 Ox-Alpha (GLM-5.3 Flash),太牛了!

远低于 V4 Flash 的价格,完爆 V4 Flash Vision 的能力,新的斩杀线来了。

整体能力我感觉和 V4 Pro 差不多,但如果算上审美、前端表现以及多模态能力,我觉得要比 V4 Pro 强很多。

在实际场景下我主要做了三个测试:

1. 无提示海报复刻前端 给它一张海报,不给任何提示,让它用前端去复刻。这基本考验的是 WebGL Three.js 3D 渲染能力。

它一次性就搞定了,效果非常好,跟 Fable 5 搞出来的差不多(Fable 5 稍微好一点点)。而在这一项里,DeepSeek V4 Flash Vision EXP 表现非常拉胯。

2. 视频还原网站交互与 3D 渲染:

给它一段视频,让它还原整个网站的交互和核心 3D 渲染部分。第一次生成基本就差不多了,只是玻璃的方向有点问题;提醒了一句之后就顺利搞定,效果极好。

玻璃的颜色非常取决于环境光,没有环境光的话参数再怎么调都调不好,它自己想到了这一步,做得非常出色。

3. 基于海报制作视差滚动网页:

给它一张海报,让它做一个视差滚动的网页,效果也巨好。它自己做了一些发挥,把海报中的元素拆出来做成了纵向滚动网页,体素会不断往下掉,视觉上非常漂亮。

不管是从综合表现还是价格维度来看,GLM-5.3 Falsh哪怕比涨价后的 DeepSeek V4 Flash 都要更便宜,算上限时折扣的话几乎等于免费。

模型的价格决定了 AI 的渗透率能提升多少。我们现在非常需要这种价格极低、能力处于中档水平的模型,以此来提高渗透率,让更多人能用上 Agent。

从这个角度来说,这个模型非常优秀,直接把模型的斩杀线往前推了一大步
00:39
1010
歸藏
3天前
Codepilot 0.67.10 更新了,本次更新内容:

优化了模型选择器(现在可以收藏对应的模型和渠道)

修改了右侧边栏的交互:

支持打开文件树、看板;同时内置浏览器升级为真正的浏览器,不仅能访问外部网页,还可以把需要的 Tab 固定在上面

Windows 端支持自动更新与增量更新

支持了 GLM 5.3 Flash

github.com
00
歸藏
4天前
OpenAI 发布了他们自研的芯片,而且直接击败了英伟达、AMD 和谷歌所有可比可测芯片的推理 ASIC。

感觉 AI 领域的竞争已经到了下一个阶段: 现在大家除了拼模型能力以外,也在拼成本以及整个供应链的整合。

这款芯片专为大语言模型推理从零设计,从 2024 年中开始设计到流片只用了 16 个月。

它是通用的推理芯片,并非只能跑 OpenAI 自己的模型。在文章展示中,他们测试了 DeepSeek R1 以及 Kimi 2.5 的推理效率,可以跑各种模型和工作负载,甚至能跑 Doom 游戏。

目前该芯片只有工程样品,量产爬坡会在 2027 年开始,大部分产能预计在明年年底铺开。

这款芯片专门针对每瓦性能(能效比)进行设计。因为当前数据中心的核心瓶颈是电力,而非预算或占地面积,所以它必须在极低功耗下实现尽可能高的推理效率。

它的每瓦吞吐量全面碾压英伟达的 Blackwell,甚至超过了采用 HBM4 Rubin:

DeepSeek R1 超过 700 token/s/用户
GPT OSS 超过 1400 token/s/用户
Kimi 2.5 接近 700 token/s/用户

值得一提的是,OpenAI 尚未发布的 Astra AI 模型也深度参与了这款芯片的设计,这或许是它拥有极高能效且开发周期极短的关键原因。

芯片团队通过 Codex GPT Astro,在两个月内把三个原本不在生产计划内的开源模型优化到了最高性能;AI 生成的部分模块比人类专家编写的模块还要快 1.5 1.8 倍。

颇具讽刺意味的是,跑在英伟达 GPU 上的 OpenAI 模型,正在帮助设计旨在击破英伟达 CUDA 护城河的芯片。

OpenAI 的下一个目标是达到 100MW 的部署规模,并计划于今年年底开始在自家的基础设施中正式部署该芯片。
34
歸藏
5天前
试了一下字节刚发布的“豆包工作”,非常豪横,上来就先送一个月的标准会员;

如果你已经买了会员,也会免费顺延一个月,可以说是雨露均沾。

豆包确实早就应该单独推出一个面向工作场景(或者说泛工作场景,包括一些 coding)的客户端。

因为大家对豆包 App 原本的认知已经固化了,觉得它就是一个用来解决日常问题、快速完成简单任务的工具。

我觉得这次的核心优势在于,字节在办公场景下有“飞书”这个杀手锏。飞书在 AI 基建和 AI 能力适配方面一直是国内最好的办公工具之一,我自己每天也都在用它处理会议纪要等工作。

豆包工作切入办公场景,尤其是跟飞书结合后,带来了很多独一无二的体验:

首先是获取完整上下文:飞书里的所有上下文都能被豆包获取。它可以帮你管理群聊信息、会议纪要和文档,提醒你今天该做什么、遗漏了什么,甚至帮你操作日历、建群拉人,把占去大量时间的琐事全包揽下来。

然后是专属知识库:很多人的会议纪要和文档都沉淀在飞书里,这自然而然就成了个人或团队的知识库,豆包可以直接基于这些完备的上下文进行创作。

我之前就说过,上下文越多的地方效果越好;有时候一个普通模型搭配完备的上下文,效果远好于没有上下文的高级模型。

推动组织 AI Native 化转型:在接入公司内部数据后,豆包可以用来搭建看板、做数据处理,直接从多维表格等数据源拉取数据,让整个公司在组织 AI Native 化的进程上大幅提速

豆包工作基本上有现在 Agent 的所有常见能力。

通用 Agent 能力: 具备文档、表格、PPT 的生成能力,以及网页和应用的搭建与生成能力,同时也支持浏览器和 Computer Use。

丰富的 MCP(连接器)生态: 可以连接到各种地方获取上下文,比如飞书、Notion,以及国内各行业的连接器(涵盖法律、新媒体、出行、编程、学术,甚至学生场景)。内置了各种行业的 skill MCP,不用到处去找,直接选合适的用就行。

针对 Windows 场景的优化与云电脑协同: Computer Use 重点优化了国内办公最普及的 Windows 系统。同时云电脑功能也很顺滑,云端对本地的控制以及手机、云电脑和豆包 App 之间的协同非常流畅,能快速同步和控制。
网页生成与局部修改: 右侧生成的网页支持快速、方便地选定位置进行微调、标注和局部修改,用户体验很好。

这里领会员 doubao.com/work
1912
歸藏
5天前
有意思,Codex 5 小时限制回来了,但是只针对 Plus 用户生效。

根据 Tibo 的解释,这主要是因为:

1. 5 小时限制可以帮 OpenAI 平衡负载
2. 他们的额度很少,这样可以防止 Plus 用户不小心一下用完自己整周的额度,导致很沮丧

Pro 用户无论是 100 美元还是 200 美元,都不会有 5 小时的限制
103