刚刚,Claude 5.1 发布!全球最强模型来了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,Claude 5.1 发布!全球最强模型来了
9576点击    2026-09-02 08:50

就在刚刚,Anthropic 推出新一代模型 Claude Fable 5.1 和 Claude Mythos 5.1。


Anthropic 称 Claude Fable 5.1 是目前最强大的公开可用模型之一,专为复杂推理、长周期任务和 Agent 工作流打造。而 Claude Mythos 5.1 则代表他们探索的更高能力边界。


需要注意的是,虽然两者共享相同的基础模型能力,但针对不同使用场景采用了不同的安全措施。


其中 Fable 5.1 面向普通用户、开发者和企业开放,Mythos 5.1 则面向经过审核的高风险领域合作伙伴,保持更严格访问控制。


换句话说,一个负责进入现实世界工作,另一个则被留在更严格控制的环境里。而这也或许是 Anthropic 对未来 AI 产品形态的一次探索:最强模型,不一定会以同一种形式提供给所有人。


官方则表示,这两个模型代表了 Claude 系列能力的重要进展,并展示了他们如何在提升模型能力的同时,继续推进安全部署。


刚刚,Claude 5.1 发布!全球最强模型来了


作为「地表最强」模型的 Fable 5.1,性能表现依旧能打,官方数据显示,Fable 5.1 多项基准测试的表现均优于上一代旗舰 Fable 5。


刚刚,Claude 5.1 发布!全球最强模型来了


但能力更强,价格却便宜了。Anthropic 表示,Fable 5.1 保持基础价格不变,缓存读取成本相比 Fable 5 降低了 75%。在实际使用中,这使模型的整体成本对于典型工作负载降低约 25%;对于高度 Agent 化的工作负载,成本最高可降低 45%。


刚刚,Claude 5.1 发布!全球最强模型来了


看来,就连最强大模型也在讲究性价比了。


下面来具体看一下。


低档位追平上一代,Fable 5.1 主打「性价比」


相比单纯刷新榜单,Anthropic 这次更想强调的是:Fable 5.1 可以用更低的推理成本,完成过去需要 Fable 5 高档位才能完成的任务。


根据官方测试,Fable 5.1 在低、中等推理强度下,已经能够取得接近甚至超过 Fable 5 的表现。Claude Code 默认使用高推理强度,Claude Cowork 和 Claude.ai 则默认使用中等强度,用户也可以根据任务复杂程度,在速度、成本与效果之间进行调整。


具体来看,Fable 5.1 在科学研究型 Agent 基准 Terminal-Bench-Science 0.1 中取得 52.6% 的成绩,相比 Fable 5 的 24.7% 提升超过一倍;在 Terminal-Bench 4.0 中,Fable 5.1 达到 55.8%,开放更多能力的 Mythos 5.1 进一步达到 60.9%。


在知识工作、计算机操作和业务流程测试中,新模型同样取得提升。AutomationBench 成绩从 Fable 5 的 17.1% 提高到 31.4%,CursorBench 3.2.0 则从 70.5% 提高到 73.4%。


刚刚,Claude 5.1 发布!全球最强模型来了


多项基准测试中,Fable 5.1 的成绩均超过 Fable 5,科学研究型 Agent 与商业工作流能力提升最为明显。


刚刚,Claude 5.1 发布!全球最强模型来了


Terminal-Bench 4.0 测试中,Fable 5.1 与 Mythos 5.1 在不同推理强度下均超过上一代 Mythos 5。


刚刚,Claude 5.1 发布!全球最强模型来了


在 Terminal-Bench-Science 0.1 测试中,Fable 5.1 最高得分达到 52.6%,超过 Fable 5 的两倍。


Anthropic 认为,Fable 5.1 的一项重要变化,是更愿意追踪问题的根本原因,也更适合执行持续数小时甚至数十小时的复杂任务。


投资机构 Millennium 在测试中发现,一段内部代码大约每百万次运行会崩溃一次。这个问题困扰工程团队四五年,其他模型也没有找出原因。Fable 5.1 则通过反汇编外部供应商的程序库、比对核心转储文件,最终将问题定位到第三方程序库中的一个 Bug。


Ramp 还让 Fable 5.1 连续运行了 38 小时。模型在发现原有机器学习结果受到标签错误影响后,自行修正问题,并发启动六组实验,最终整理出新的结果与后续建议。


从写代码到做科研


这次发布中,Anthropic 用相当大的篇幅介绍 Fable 5.1 与 Mythos 5.1 在科学研究中的表现。


在蛋白质设计实验中,研究人员让 Mythos 5.1 调用开源蛋白质设计与折叠工具,再将生成的设计交给两个外部机构进行实验验证。


在三个目标蛋白上,Mythos 5.1 设计的结合剂亲和力达到 Adaptyv Bio 相关蛋白质设计竞赛最佳方案的 10 倍。面对 12 个目标蛋白时,模型设计的有效结合剂命中率接近 50%,而 Anthropic 给出的行业常见水平为 10% 至 15%。


Fable 5.1 还利用 30 多年前 NASA 麦哲伦号探测器采集的雷达图像,为金星约三分之一的表面生成了一张新的高分辨率高程图。


刚刚,Claude 5.1 发布!全球最强模型来了


NASA 麦哲伦号探测器拍摄的金星雷达图像,画面中央为一座直径约 15 公里的小型盾状火山。


原有地图只能呈现 10 至 20 公里尺度的细节,新地图将分辨能力提高至 2 至 3 公里,高度测量准确度最多提升 25%。Anthropic 计划以知识共享许可公开这张地图,供 NASA VERITAS 和欧洲航天局 EnVision 等后续任务参考。


在计算生物学领域,Mythos 5.1 通过编写定制 GPU 内核、缓存中间结果,将 7 个开源蛋白质与基因组深度学习模型的运行速度最高提高 2.5 倍,同时保持输出结果一致。在部分全基因组分析任务中,预计可以降低 30% 至 60% 的 GPU 成本。


刚刚,Claude 5.1 发布!全球最强模型来了


Mythos 5.1 优化 7 个开源蛋白质与基因组模型后,推理速度提高 1.4 至 2.5 倍。


Anthropic 想借这些案例证明,模型正在从整理资料、编写代码,进一步走向提出方案、运行工具并交付可供实验验证的科研结果。


缓存价格降了 75%,Agent 任务最高便宜 45%


性能之外,价格是 Fable 5.1 最直接的一个变化。


Fable 5.1 的输入和输出价格没有调整,仍为每百万 Token 10 美元和 50 美元,但缓存读取价格从原来的水平下调 75%,降至每百万 Token 0.25 美元。


缓存读取指的是模型重复使用已经处理过的上下文。普通问答中的占比可能有限,但在需要反复读取代码库、历史对话和工具结果的 Agent 任务中,缓存往往构成主要成本。


按照 Anthropic 对 2026 年 8 月实际使用数据的测算,Fable 5.1 运行典型任务的整体费用比 Fable 5 低约 25%;对于上下文较长、工具调用频繁的复杂 Agent 任务,成本降幅最高可达到约 45%。


刚刚,Claude 5.1 发布!全球最强模型来了


缓存读取价格下调后,Fable 5.1 典型任务成本降低约 25%,高 Agent 化任务成本最高降低约 45%。


Fable 5.1 现已登陆 Claude.ai、Claude Code 和 Claude API,同时通过 AWS、Google Cloud 与 Microsoft Azure 提供。开发者可以通过 claude-fable-5-1 调用新模型。


防蒸馏机制再加强


Fable 5.1 和 Mythos 5.1 实际上使用了同一个底层模型,二者的主要区别在于安全限制。


Fable 5.1 面向普通用户和企业全面开放;Mythos 5.1 则拥有更宽松的网络安全和生命科学限制,目前只提供给经过审核的个人与机构。


在网络安全领域,Fable 5.1 已经可以帮助用户发现软件漏洞,但仍不能直接生成漏洞利用程序。渗透测试、漏洞利用生成和基于二进制文件的漏洞扫描等双重用途任务,依然可能被转交给限制更严格的模型处理。


经过调整后,新版网络安全防护机制的误拦截次数较 Fable 5 减少约 60%。生物安全机制对基础生物学和医疗问题的误拦截率也降低了 85%,涉及生命科学研发的高级能力则主要通过 Mythos 5.1 的审核计划开放。


Anthropic 还推出了 Enterprise Frontier Safeguards。企业可以将数据保存在自己控制的云基础设施中,由企业负责默认的人工审查,从而在保留安全监测能力的同时,实现接近「零数据保留」的隐私效果。这套机制计划从今年秋季开始分阶段上线。


针对大规模模型蒸馏,Fable 5.1 也加入了新的限制。当天以后创建的 API 账户,将无法在保留 Claude 历史思考记录的同时,手动修改多轮对话中的先前上下文。Anthropic 表示,这项改动主要用于阻断一种已经公开的能力提取方法。


此外,为满足欧盟《人工智能法案》的要求,Fable 5.1 的文本输出将包含不可见水印。Anthropic 同时开始小范围测试检测 API,首批面向监管机构、媒体、事实核查组织和研究机构开放。


最后,网友说得对,早起的鸟儿早用到 5.1。


刚刚,Claude 5.1 发布!全球最强模型来了


参考链接:


https://x.com/claudeai/status/2094848572143407483


https://www.anthropic.com/claude-fable-and-mythos-5-1


https://techcrunch.com/2026/09/01/anthropics-new-fable-release-is-cheaper-less-restrictive/


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md