速评qwen3.8-max-preview:Coding 能力和 Kimi K3 一个水平,超越 GLM 5.2,不如 Fable 5。
依然是跑了葬 AI 基准测试,GPT 5.6 Sol 和 Fable 5 断半档领先Qwen 3.8 preview和 Kimi K3,后两者区别很小。尤其是两个模型都还不稳定,都有超低分轮次拉低平均分。但 Kimi K3 相较 Qwen 3.8 preview更不稳定,高分很高,但低分轮次更多,可能是由于推理资源(aka 卡不够)的问题。
图一是详细排名,但Qwen 3.8 preview是预览版,Kimi K3 很不稳定,每天测出来的结果都不一样,只能看个大概意思。下周发稿这两个模型时会重跑测试。
问题在于,Qwen 3.8 preview的非 Coding 能力不行。
应该是没有针对非 Coding 能力做后训练,还没来得及,Kimi K3 肯定是优化过的。
比如图二,同样是根据杨圣照片生成 3D 模型,GPT-5.6-Sol 效果一眼最好,Kimi K3 和 Fable-5 其次,都属于能看出来人样的水平。而 qwen3.8-max-preview生成的就很难称之为人了。最糟糕的是 Seed Evolving(Seed 最新版本)直接生成了一个方块。
我的直观体感是,Qwen 3.8 preview和 Kimi K3 的Coding 能力是一个水平,但Qwen 3.8 没有优化非 Coding 能力。不过考虑到这是预览版,Qwen 3.8 将按日更新,看看正式版能不能提升全面能力。
更新:图一榜单增加了 GPT 5.6 Sol,重跑了 Opus 4.8、Qwen 3.8 和 K3。
修复了 Opus 得分异常的问题。K3 排名上升一位,Qwen 3.8 依然名列第三。
考虑到 Qwen 3.8 preview 得分很不稳定,还在激烈更新中,这个榜单只能反映我测试时 Qwen 的Coding能力,之后每次引用榜单,我都将重跑 K3 和 Qwen 3.8 成绩。