即刻App年轻人的同好社区
下载
App内打开
歸藏
567关注28k被关注50夸夸
产品设计师、模型设计师、 不会代码的独立开发者。
关注人工智能、LLM 、 Stable Diffusion 和设计。
歸藏
11:44
正在做一个非常牛皮的 Skill,希望能彻底解决口播视频剪辑和包装的痛点
62
歸藏
11:16
FLLUX 3 正式可用了

目前支持最长 20 秒、1080P 原生分辨率的视频,后面还会开放 2K 4K 分辨率。

此外,它还支持草稿模式,可以以极低成本快速探索创意,然后再重新以完整的质量进行渲染。草稿一次只需要 0.06 美元。

目前支持的功能包括: 文生图 文生视频 图生视频 生成对应音频和不错的文本渲染能力

可以通过 API 和黑森林工作室的 Playground 来尝试
01:00
15
歸藏
11:15
Pika有意思,他们开始搞多模态模型的 Token Club,推出了一个会员服务叫 Pika API Club。

里面包含了几乎所有的图像、视频、LLM模型服务,而且都有不同程度的折扣。

比如 Seedance 2.0、MiniMax H3、可灵(Kling),还有 GPT-Image-2.0 等都有。

完全可以充了以后,打包个 Skills 给那个Codex或者其他 Agent 接入,以后就可以一键调用所有的这种视频和音频 API 模型
01
歸藏
1天前
Cloudflare 推出了一个专门给 Agent 用的钱包,它有一个唯一的地址和用户名,这个有意思啊!

领了以后,你的 Agent 就可以用这个钱包来支付 API 和内容的费用。

可以先申请一个自己名字的,以防被人抢注。

钱包分为两类:

钱包账户:是你作为人类拥有的钱包,可以充值、提现,也可以把支出权限委托出去

虚拟钱包:是专门为 Agent 设计的,通过 API Key 运行

关于虚拟钱包的支出控制和使用场景:

支出上限和规则:你可以给它设置支出上限,也可以通过允许列表(白名单)和规则进行控制

受控预算与自主探索:这样的设计可以让 Agent 在受控的预算内,自主探索各种服务

免去实时监控:我们人类没必要时刻监控它的支出,也不用担心它直接把卡刷爆

此外,它还通过 Cloudflare Pay 把钱包和账户身份关联起来。Agent 可以选择性地表明自己代表哪个组织,从而解决了 Agent 的身份认证问题(身份证明是可选的,也可以选择匿名)。

详情:cloudflare.pay
010
歸藏
1天前
OpenAI 发了一篇文章,回应苹果关于窃取商业机密的诉讼,没想到苹果这么草台。

苹果声称今年 2 月份联系过 OpenAI 但没有收到回应。后来发现,是苹果的律师把两个亚洲姓氏搞混,把邮件发错人了。

苹果还声称和 OpenAI 的总法律顾问通过话,但其实根本没有,完全是骗人的。

之后苹果沉默了 5 个月,突然就提起了诉讼。

苹果指控其前员工在离职后访问机密信息。但事实是,苹果在职的员工主动联系这位前员工,请他帮忙寻找对应的文件,她这才进行了访问。

这一堆操作下来太搞笑了
14
歸藏
3天前
玩玩 Midjourney
50
歸藏
4天前
OpenAI 感觉翻身了啊,已经在预热他们的下一代模型Astra。

他们用这个模型解决了 10 个至少存在了十年的数学问题。

这些问题如果是数学家解决的话,感觉这数学家已经相当牛逼了;

而解决这一堆非常难的问题,算力成本居然只有 2000 美元。

Sam 亲自飞到华盛顿去跟美国政府沟通这个模型的发布,感觉这玩意儿会很顶,不知道是 GPT-6 还是 GPT-5.7

详情:openai.com/index/ten-advances-in-mathematics/
34
歸藏
5天前
做影视后期、动画特效以及一些转场,MiniMax H3真的太牛逼了!

我在视频里标注了自己的工作流,包括素材、提示词。

基本上你把特效的图片分镜标注好,用现在的图像模型做好,或者自己把文字等特效层 P 上去,甚至只是给一些参考,它就能帮你做出非常复杂的动特效。

它的文字和 UI 细节、排版细节效果巨好。

我做的两个案例都用了九宫格图片,按理说总分辨率只有 1K 左右,但它生成出来的清晰度极高,完全没有以前那种字迹模糊看不清的状态。

支持全模态参考。而且还会开源,开源后成本会降低。

非常适合用来做广告片、产品宣传片、MV、游戏宣传和电商宣传,或者做个特效来包装自己的照片和视频。这些大家都有强烈的需求。
01:06
315
歸藏
6天前
Deepseek V4 Flash 更新到正式版了,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本!

官方测评成绩:

Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
DSBench-Hard: 59.6

目前已经在官方 API 上线,同时还支持了 Codex 的 API 格式,可以快速配置。

Mac 一键配置脚本:bash <(curl -fsSL cdn.deepseek.com)

Windows 一键配置脚本:irm cdn.deepseek.com | iex

DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。

详情:api-docs.deepseek.com/zh-cn/updates/
46
歸藏
6天前
发现了 Codex 一个非常牛逼的更新,好像没见他们宣传!

Codex 现在有专门给图像 Agent 做的 UI 模式了:

生成图片后,点击图片会单独弹出一个侧边栏预览窗口。在这里面,你可以直接对图片进行评论、擦除和调整大小。这完全是专门给 GPT Image 2.0 做的。

左上角有一个切换按钮,切换以后,聊天流里就只显示图像,不显示那些文案了。

这样你就可以专注于调整图像,快速看到聊天里生成的所有大图。

你可以多选图片,一并添加到输入框里,然后让 GPT 给你进行批量修改。

这个更新感觉要把设计 Agent 的活吃掉一大半了。

这种方式我觉得是要比现在主流的无限画布等复杂的交互逻辑,要更容易理解的。
624