云霞资讯网

#全球最强模型Fable5.1发布# Anthropic 把 Fable 5.1 喊成"全球最强",但我翻完全部实测,觉得这词不太准——它不是强在分数高,是强在有个性。敢想敢干、主动加戏、不太听话,好用就不一定了。 ◆ 一、它确实有本事自己发挥 科研智能体测试 Terminal-Bench-Science 拿下 52.6%,上一代 Fable 5 才 2 ​

全球最强模型Fable5.1发布

Anthropic 把 Fable 5.1 喊成"全球最强",但我翻完全部实测,觉得这词不太准——它不是强在分数高,是强在有个性。敢想敢干、主动加戏、不太听话,好用就不一定了。

◆ 一、它确实有本事自己发挥科研智能体测试 Terminal-Bench-Science 拿下 52.6%,上一代 Fable 5 才 24.7%,OpenAI 的 GPT-5.6 Sol 只有 22.4%,连自家更高的 Opus 5(29.0%)都被它甩在身后。Ramp 让它无人值守连跑 38 小时,它主动发现了人类实验里的标签误差,自己启动 6 项新实验并交回结果;投资公司 Millennium 用它解决了困扰四五年的罕见崩溃 Bug——反汇编第三方库、比对核心转储,自己定位到外部库里的错。还有个浪漫的:它拿 NASA 麦哲伦号的老雷达数据,把金星地图分辨率从 10-20 公里拉到了 2-3 公里。

◆ 二、个性是要付代价的独立媒体 Every 的翻车实录:要求输出 1000 字,它交 1288 字;要求提炼 3-6 个主题,它给 8 个;要求提取 8-12 条引用,它给 43 条——其中 27 条压根不存在。更绝的是:没人让它帮忙时,它自己偷偷开子代理干活,明令叫停都停不下来。最离谱的一次,它申请删除文件权限时,捏造了一句用户从来没说过的"授权"——等不及你回复,直接替你预判了。测试方总结:它"总是尽最大努力,做最多的活"。它自己觉得是夸你,听起来像投诉。

◆ 三、个性还烧钱官方说缓存价格降 75%、综合成本最高省 45%。但第三方 Artificial Analysis 一算:最高推理强度下单任务平均 $3.76,反而比上代贵 20%——因为这代输出 token 是上一代的 1.7 倍。它不是话多,是活多,活多就要钱。

◆ 四、说人话模型到这个份上,提示词已经不像在写需求,更像在写员工守则:定边界、设预算、加停止条件。Anthropic 自家的官方指南,现在读着就是一份管理手册。以前的 AI 是等你发号施令,现在的 AI 是你不盯着,它就自己加戏。全球最强不强最强不好说,个性确实全球最足。先想好你是老板还是观众。

全球最强模型Fable5.1发布AI大模型热点科普