尧图精选

Fable 5.1和Mythos 5.1发布:性能登顶、价格直降,科研实战成果惊人!

🕒 发布时间:2026/9/2 23:49:50 📁 来源:尧图网络
【Fable 5.1和Mythos 5.1发布性能价格双优】刚刚Fable 5.1和Mythos 5.1发布它们在8项公开基准测试中全部排名第一价格最高降45%。尤其是在科学研究和代码这两项上明显超越了Fable 5和隔壁GPT - 5.6 Sol。用中、低推理程度跑Fable 5.1表现基本相当于老版Mythos 5开到极高甚至最高推理程度。这一波可以说是“牢Fable”干掉了“Mythos圣”。价格方面Fable 5.1把缓存读取价格降至每百万token 0.25美元降幅75%。输入和输出价格与Fable 5一致分别为每百万token 10美元和50美元。虽然看着好像只降了一项价格但实际影响较大因为在智能体任务里缓存读取占了成本的大头。Anthropic给出的数据显示典型工作负载成本比Fable 5降了大约25%如果是高度智能体化的任务最多能省到45%。【功能优势显著写作表现出色】官方发布视频称无论你此前让Claude处理什么任务Fable 5.1都能做更多并且把最难的部分完成得更出色。这是因为它擅长处理多步骤任务在这类任务中若第二步出现微小错误到第40步可能全盘皆崩而Fable 5.1能够全程稳定输出。如果遇到解决不了的难题它会告知已尝试过的方案和卡住的环节。研究员Flix Rieseberg特别提到写作方面Fable 5.1减少使用粗体也更少使用标题、列表或引号对风格提示词遵循得更好。我就想问问能不能顺便把风格提示词开源一下呢还是老规矩Fable 5.1面向所有用户开放Mythos 5.1仅通过受信访问计划提供给经过审核的网络安全和生命科学机构。【科研实战成果丰硕】除了跑分Anthropic还展示了Fable 5.1和Mythos 5.1在科研领域的实战成果。在蛋白质设计方面Anthropic让Mythos 5.1使用开源蛋白质设计和折叠工具设计高亲和力结合蛋白并将方案送至两家外部机构做实验验证。在三个靶标上Mythos 5.1设计的结合亲和力是Adaptyv Bio蛋白质设计竞赛最佳方案的10倍。在全部12个靶标上命中率接近50%而当前蛋白质设计领域的典型命中率在10%到15%之间。高亲和力结合蛋白是许多常见药物开发流程中的第一步直接决定了药物能否在较低剂量下发挥作用。天文学方面Fable 5.1基于NASA麦哲伦号30多年前拍摄的雷达图像训练了一个神经网络为金星三分之一的表面生成了新的高分辨率地形图。此前已有的地形图仅覆盖金星五分之一的面积分辨率在10到20公里之间。Fable 5.1把分辨率提升到了2至3公里高度精度比此前提高了25%。这份地图已以CC协议开源发布供即将到来的NASA VERITAS和ESA EnVision任务参考帮助确定未来观测的重点地质特征。计算生物学方面Mythos 5.1通过编写自定义GPU内核并缓存中间结果将7个开源深度学习模型的运行速度提升了最高2.5倍输出完全一致。在实际研究中生物学家可能需要对这些模型运行数千次测试每个人类基因附近的所有可能突变优化后的模型可将GPU成本降低30%到60%。这类优化通常需要一个性能工程团队花费数周完成许多学术实验室根本无力负担而Mythos 5.1仅用数天便做到了且仅依赖公开源代码。Anthropic计划近期将这些优化开源。【反蒸馏机制上线规定与改动并存】伴随着Fable 5.1发布还有一些特别的规定和API改动。安全方面Fable 5.1的网络安全误报率比Fable 5降低了60%现在允许用于发现软件漏洞但仍禁止开发漏洞利用程序。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务仍会被重定向到Opus系列模型。基础生物学和医学问题的误报率降低了85%但涉及生命科学研发的查询仍路由到Opus模型处理专业人员需通过Mythos 5.1的生命科学验证计划LSVP获取访问权限。新增的反蒸馏机制是个重磅改动。从今天起新注册的API账户无法在多轮对话中手动编辑Claude上下文的同时保留思维链记录。之前有一种常见手法在多轮对话中手动篡改Claude之前的上下文但刻意保留思维链记录这样就能在一组新的、可能带有对抗性的指令下重放模型在另一组指令下产生的推理过程。现在这条路被直接堵死了。做法是给每个思维链区块都加上一个签名signature。当用户在后续请求中把助手的回复发回API时系统会用这个签名做两件事验证当前模型是否有权读取这个区块以及验证这个区块之前的整段对话包括系统提示词、工具列表、所有历史消息是否跟当初生成它时一模一样。只要对话中有任何东西被动过签名校验就会失败。失败之后怎么处理取决于开发者设的一个参数prefix_mismatch_behavior默认值是“error”直接返回400状态码请求被拒如果设成“drop_block”系统会静默丢掉这个区块以及它之后的所有思维链请求本身照常执行。被丢掉的部分不计费并且会在响应里的input_transformations数组中列出来。文档给出了会触发校验失败的操作清单编辑、重新排列或删除任何先前的用户/助手/系统消息改动顶层系统提示词对工具列表做任何增删改名操作从对话历史中间抽掉某个思维链区块但保留后面的区块以及引用了一个在两次请求之间返回了不同内容的图片或文档URL。以上任何一条都会导致后续所有思维链区块失效。反过来有些操作是安全的在对话末尾追加新消息、从历史记录开头移除思维链区块、改max_tokens之类的请求参数、增减cache_control标记以及服务端的压缩compaction或上下文编辑context editing这些都不会触发校验失败。还有一个链式校验的设计每个思维链区块会记录它前一个区块的信息形成一条跨轮次的链条。可以从链条的头部摘掉区块但如果从中间抽掉一个那它后面的每一个区块都会跟着失效整条链从断裂处往后全部作废。为了不让开发者被卡住Anthropic同时提供了一系列替代方案可以在不碰历史记录的前提下达到同样的效果。需要中途改指令用对话内系统消息mid - conversation system message替代直接改顶层提示词。需要每轮加个临时提醒用带clear_at参数的轮次级系统消息替代“先插入再删除”的老办法。需要中途增减工具用tool_addition和tool_removal区块替代直接编辑工具列表。需要裁剪上下文用服务端压缩和上下文编辑替代客户端粗暴截断。如果你用的是Claude Code、claude.ai、Claude Managed Agents或Claude Agent SDK这些官方产品什么都不用改它们已经自动保证对话前缀不会被篡改。但如果你是直接调Messages API的开发者Anthropic的建议是把messages数组严格当作只追加append - only来用然后在prefix_mismatch_behavior设为”drop_block”的模式下跑一遍完整的多轮会话测试看日志里有没有冒出prefix_binding_mismatch条目。最后文档里还特别提了一个容易踩坑的场景。如果你维护的是一个工具或框架用户拿自己的API密钥来调用那新注册用户会更早撞上这个校验。因为开发者自己的密钥大概率是8月31日之前注册的暂时还没被强制执行。对于这种情况建议主动设好prefix_mismatch_behavior提前测试别等用户先炸了你才发现。【引发行业反应】A社整出这么大动静隔壁OpenAI肯定坐不住。但他们家新模型Astra还没弄好只好先象征性地发点预告。还有Ilya在Fable 5.1和OpenAI Astra发布之际也少见地出来喊话呼吁加强网络安全。这一系列的操作和反应不禁让人思考未来AI行业的竞争格局会如何发展呢
上一篇/下一篇内容由系统自动关联 返回资讯列表 →