我让 Jev 和 opus-5、opus-4.8、terra、luna、gemini 这6个模型同时测评一批文章,看谁能更快找出不恰当的比喻。最后发现,Jev 确实速度很快,标注结果可复用,但是准确度并没有提升,甚至语义理解上不如opus 5。 我一直在做一个 AI 味测评,其中一个重要指标是模型写比喻句(包括明喻、暗喻等)的贴切度。Jev 发布之后,我觉得它很适合用来做模型能力测评和打标,所以我简单做了个小实验,看看它效果到底如何。
我给了这6个模型3篇 AI 写的文章,让它们找出其中不恰当的比喻句。我之前说过,AI 无法真正写作的一个表现是 AI 写不出贴切的比喻。同理, AI 也很难判断什么是好的比喻。一篇有202句的文章,Jev 只花了2.6秒就标注了所有句子,速度确实一骑绝尘。相比之下,opus-5 非推理模式花了8.2秒,gemini花了88.3秒,gpt5.6 terra、luna都在160秒以上。
不过,Jev 标注的准确性并没有优于其他模型, Jev 打分最高的最有可能是比喻不贴切的句子,是这句:“顶层是一般智力因素,也就是心理学中著名的 g 因子,代表一种统一的认知能力底层驱动力。”(P1 Jev标注有明显不贴切比喻的句子)
在明显的比喻句上,Jev 找出的概率却很低,例如有 10 句是带明显标记词的(就像、好比、如同、木桶、短板、 遮羞布之类),Jev 一句都没有标注上,opus-5 明显更好,10句里面找到了5句。(P2)
对于多次出现的生硬的“尺子”这一比喻,Jev 的打分只有0.32、0.31、0.30。这是我觉得非常明显的AI滥用比喻的案例,但 Jev 对此并不敏感。(P3)
Jev 当然也有它明确的好处,它输出的是对所有句子的标注,因此我们可以拿着数据做很多分析。但其他模型,输出的只是“哪些句子有不贴切比喻”这一个答案,并不是全量的标注,因此也不能复用。
总之,Jev 在理解比喻这件事上,并没有比其他模型进步多少,甚至可能还不如现有模型。当然,学不会比喻这件事,是所有模型共同的难题。