即刻App年轻人的同好社区
下载
App内打开
歸藏
567关注28k被关注51夸夸
产品设计师、模型设计师、 不会代码的独立开发者。
关注人工智能、LLM 、 Stable Diffusion 和设计。
歸藏
1天前
难道是 GPT-image 2.5 要发布了吗?

有人发现 ChatGPT 中上线了一个新的弹窗,看起来是图像模型的升级。
30
歸藏
1天前
ChatGPT 官号开始预热,今天晚上 GPT Astra几乎肯定会发布,压一手凌晨 1
33
歸藏
1天前
我去,这是哪家上游服务商炸了吗?

OpenAI、Cloudflare、Cursor、SpaceX 全炸了
84
歸藏
1天前
我去!终于搞定了我的旅行照片海报 guizang-yingzao-skill

支持将你的旅行照片通过内容检索、排版,最后在 Codex 调用 GPT-Image 2.0,生成一个非常漂亮、同时能传达这些古建历史的海报。

感兴趣的话可以试试,因为最近中秋节和国庆节要到了,大家可能都想去山西之类的一些古建大省去旅游。

github.com
08:03
14
歸藏
1天前
Grok bot 终于上安卓了。这种东西,手头没手机的时候是真的好用。

把一些常用工具和上下文,比如一些 skill 之类的连接上去以后,临时处理个文案图片之类的很方便。

这个配图就是用安卓 Gork 处理的。
02
歸藏
2天前
昨晚 Claude 发布了 Fable 5.1 Mythos 5.1,两者的权重相同。

输入输出价格和 Fable 5 一样,缓存价格降了 75%。

官方的说法是,按 token 计费的话,典型负载大约会便宜 25%,重度 Agent 负载大概会便宜 45%。

但时间线上全在说 Fable 5.1 的订阅额度消耗得非常快,可能 20 分钟、半小时整个额度就用光了。

而且这模型还有一些更严重的问题:

不支持强制的 tool choice,更早的模型读不了它的 thinking block,导致不能中途换模型,改历史消息会让 thinking 失效。

输出带有不可见的文本水印(这个之前聊过,非常恶心,会导致生成的文案质量变差)

Artificial Analysis Anthropic 做预发布测评的反馈显示:即使缓存降价 75%,Fable 5.1 Max 跑完任务的实际开销依然比 Fable 5 Max 20%,因为它的输出 token 大约是 Fable 5 1.7 倍。

看起来还是挺拉胯的,反而更贵了,再加上隐形文本水印以及无法切换模型这些问题。

是不是意味着一旦它触发了安全护栏,你切到 Opus 5,缓存就直接失效掉了,随后调用成本跟着大幅上涨?
15
歸藏
2天前
李飞飞的 World Labs 发布了他们新的世界模型 Atlas,这个看起来比上一代厉害多了。

通过一张图片就可以创建一个非常完整的 3D 空间场景,你可以在里面随意运动,它也能理解时间的演变规律。

它能将一张或多张输入图像整合进一个共享的空间上下文中,让每张图像都锚定在三维空间中的具体位置,再以此继续生成后续内容,既能保证当前场景的一致性,又能想象出没有看到的内容。

它主要支持三大任务:

生成图像和视频:能从一张或多张参考图出发,以像素级精确的相机控制生成不同角度的图像或完整视频,最长可输出 1 分钟 1440p 的视频

3D 场景重建:用一张或几十张图片重建真实的 3D 场景,直接生成点云、3D 高斯泼溅(3D Gaussian Splatting)等三维结果(图片越多还原越真实),效果甚至超过了专门针对 3D 高斯泼溅优化的模型

时空仿真:能把几台普通手机拍摄的视频重新取景成“子弹时间”效果,还可以为机器人训练生成测试数据

过几周才能用
01:25
012
歸藏
3天前
优化了一下新的 Skill 效果更好了
40
歸藏
3天前
还得是 Twitter,很难想象会跟纳瓦尔本人产生交集
31
歸藏
3天前
Runway 发布的这个新模型 Solaris 挺有意思,他们说是首个界面世界模型,本质上叫新型操作系统,可以逐帧实时生成交互界面。

它生成的视频能根据你的点击和拖动实时发生变化。比如下面这个例子:

向上拖动树,树就会变大
向斜下方拖动壁画,壁画也会变大
把灯拖出来移动位置,它就会放到你拖动到的最终位置,并重新渲染光线和物体之间的交互
点击的话还会弹出一个 UI 选项,让你去变换样式

这一切都是基于视频模型去完成的。

我觉得这个想法和思路还是挺好的,但目前实时生成的问题依然比较大。

主要问题在于延迟、实时生成的成本、一致性,以及连贯性和速度问题
00:12
14