即刻App年轻人的同好社区
下载
App内打开
葬愛咸鱼
726关注3k被关注3夸夸
大仲马转世灵童
vx:funeralSALTEDfish
置顶
葬愛咸鱼
2月前
我感觉做啥事情都是一样,你要么很有判断力,咬紧牙关不动摇,相信自己赌一把;要么不需要判断力,紧跟趋势,什么火做什么,干就完了。两个极端都能收获应有的奖赏。

最糟糕的是中间那一大批人,有点判断力又不坚定,热点没蹭到,也没能证明自己的判断力。
1615
葬愛咸鱼
02:40
大模型测评很像吃播。卷到后边,吃龙虾鲍鱼都不够看了,就得吃要么超级贵要么超级稀奇的,比如七八千的日料,手臂长的大虾。那随便跑一次复杂点的 bench,api 费用一两千就花出去了。跑三次求稳定那就是大几千,跟吃播录一次视频的成本差不多。

我的意思是半夜饿了。
00
葬愛咸鱼
02:21
误会了,泔水大赛第一名是 TapNow 员工,这哥们生成了个视频讲泔水大赛冠军是 LibTV。就不给主办方自己人发奖了,奖品给了第二名。不给这个误会增加了节目效果 Amian!

HaydenHe: TapNow 的格局还是小了点,昨天泔水大赛的第一名是 libtv 的员工,奖项选择了拒发。更搞笑的是,泔水的视频,讲的就是:TapNow 第一届泔水大赛冠军是 libTv。全场掌声雷动~基本全票当选~

10
葬愛咸鱼
1天前
FDE 的意思是臭外包干驻场开发的、臭干咨询写 PPT 的,终于找到个洋气的新词,就像 AI bro发明harness、loop 这一堆垃圾词汇一样,跟上了 AI 炒作潮流,蹭一蹭。

e.g. 上门保洁是 FDE。外包记账会计也是 FDE。上门帮人安装 Claude code,这更是教科书级别的 FDE。

问题,还有什么外包不是 FDE?
152
葬愛咸鱼
2天前
更新:图一榜单增加了 GPT 5.6 Sol,重跑了 Opus 4.8、Qwen 3.8 K3。

修复了 Opus 得分异常的问题。K3 排名上升一位,Qwen 3.8 依然名列第三。

考虑到 Qwen 3.8 preview 得分很不稳定,还在激烈更新中,这个榜单只能反映我测试时 Qwen 的Coding能力,之后每次引用榜单,我都将重跑 K3 Qwen 3.8 成绩。

葬愛咸鱼: 速评qwen3.8-max-preview:Coding 能力和 Kimi K3 一个水平,超越 GLM 5.2,不如 Fable 5。 依然是跑了葬 AI 基准测试,GPT 5.6 Sol 和 Fable 5 断半档领先Qwen 3.8 preview和 Kimi K3,后两者区别很小。尤其是两个模型都还不稳定,都有超低分轮次拉低平均分。但 Kimi K3 相较 Qwen 3.8 preview更不稳定,高分很高,但低分轮次更多,可能是由于推理资源(aka 卡不够)的问题。 图一是详细排名,但Qwen 3.8 preview是预览版,Kimi K3 很不稳定,每天测出来的结果都不一样,只能看个大概意思。下周发稿这两个模型时会重跑测试。 问题在于,Qwen 3.8 preview的非 Coding 能力不行。 应该是没有针对非 Coding 能力做后训练,还没来得及,Kimi K3 肯定是优化过的。 比如图二,同样是根据杨圣照片生成 3D 模型,GPT-5.6-Sol 效果一眼最好,Kimi K3 和 Fable-5 其次,都属于能看出来人样的水平。而 qwen3.8-max-preview生成的就很难称之为人了。最糟糕的是 Seed Evolving(Seed 最新版本)直接生成了一个方块。 我的直观体感是,Qwen 3.8 preview和 Kimi K3 的Coding 能力是一个水平,但Qwen 3.8 没有优化非 Coding 能力。不过考虑到这是预览版,Qwen 3.8 将按日更新,看看正式版能不能提升全面能力。 更新:图一榜单增加了 GPT 5.6 Sol,重跑了 Opus 4.8、Qwen 3.8 和 K3。 修复了 Opus 得分异常的问题。K3 排名上升一位,Qwen 3.8 依然名列第三。 考虑到 Qwen 3.8 preview 得分很不稳定,还在激烈更新中,这个榜单只能反映我测试时 Qwen 的Coding能力,之后每次引用榜单,我都将重跑 K3 和 Qwen 3.8 成绩。

00
葬愛咸鱼
2天前
kimi 现在的情况有点像做题家考上清华后,在校门口卖 6000 一份的学霸笔记。
00
葬愛咸鱼
2天前
奶龙黑客松留念
00
葬愛咸鱼
2天前
速评qwen3.8-max-preview:Coding 能力和 Kimi K3 一个水平,超越 GLM 5.2,不如 Fable 5。

依然是跑了葬 AI 基准测试,GPT 5.6 Sol Fable 5 断半档领先Qwen 3.8 preview和 Kimi K3,后两者区别很小。尤其是两个模型都还不稳定,都有超低分轮次拉低平均分。但 Kimi K3 相较 Qwen 3.8 preview更不稳定,高分很高,但低分轮次更多,可能是由于推理资源(aka 卡不够)的问题。

图一是详细排名,但Qwen 3.8 preview是预览版,Kimi K3 很不稳定,每天测出来的结果都不一样,只能看个大概意思。下周发稿这两个模型时会重跑测试。

问题在于,Qwen 3.8 preview的非 Coding 能力不行。

应该是没有针对非 Coding 能力做后训练,还没来得及,Kimi K3 肯定是优化过的。

比如图二,同样是根据杨圣照片生成 3D 模型,GPT-5.6-Sol 效果一眼最好,Kimi K3 Fable-5 其次,都属于能看出来人样的水平。而 qwen3.8-max-preview生成的就很难称之为人了。最糟糕的是 Seed Evolving(Seed 最新版本)直接生成了一个方块。

我的直观体感是,Qwen 3.8 preview和 Kimi K3 的Coding 能力是一个水平,但Qwen 3.8 没有优化非 Coding 能力。不过考虑到这是预览版,Qwen 3.8 将按日更新,看看正式版能不能提升全面能力。

更新:图一榜单增加了 GPT 5.6 Sol,重跑了 Opus 4.8、Qwen 3.8 K3。

修复了 Opus 得分异常的问题。K3 排名上升一位,Qwen 3.8 依然名列第三。

考虑到 Qwen 3.8 preview 得分很不稳定,还在激烈更新中,这个榜单只能反映我测试时 Qwen 的Coding能力,之后每次引用榜单,我都将重跑 K3 Qwen 3.8 成绩。
36
葬愛咸鱼
3天前
00
葬愛咸鱼
4天前
什么时候能在深圳机场看到 LibTV 广告
61
葬愛咸鱼
5天前
帮哆啦A梦学家@闻烜 问一下:

知乎在北京要做一个线下『AI 受害者互助会』活动,想邀请一些 AI 被害人讲讲自己有趣的故事,有没有认识适合这个话题的人想来?比如AI创业失败、因为AI被裁员。

欢迎直接联系他。
51