尧图精选

复现 Smoke 材料约束分差:Claude Sonnet 4.6 与文心一言走 TaoToken 做对照

🕒 发布时间:2026/9/18 22:42:12 📁 来源:尧图网络
Run #156 的 Smoke 轻量快测里Claude Sonnet 4.6 在材料约束单项拿到 94.5文心一言 4.5 只有 58.5文心主榜被压到 53.83单项极差超过 33 分。更扎眼的是11 个模型里 10 个代码执行拿满分真正拉开名次的变量落在权重 0.45 的材料约束上。很多人想亲手验一遍这个分差第一步就卡住Claude 侧和文心侧要分别找渠道、分别申请 Key题面、温度、引用要求也对不齐。用 TaoToken 可以把申请 Key 这一步合并打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 注册并创建一把 YOUR_API_KEY再把 Base URL 填成 https://taotoken.net/api同一把 Key 只改模型 id 就能让两边跑同一份材料约束题。TaoToken 在这里只提供 Key 和 Base URL材料约束的题目、严格引用原文的要求、幻觉判定口径仍要自己按原文那套写。下面按 Run #156 的分数结构搭一条可复制的对照链路跑完两轮再看失败样例到底出在引用还是改写。1. Run #156 Smoke 分数拆开看材料约束权重 0.45 为什么压主榜1.1 代码执行 10 个满分后剩下的变量只有材料约束Run #156 这一轮 Smoke 快测有个很反直觉的地方代码执行项几乎没有区分度。11 个模型里 10 个拿到满分这意味着如果你只盯代码执行看到的排名会非常接近甚至误以为模型之间已经拉不开差距。但榜单最后并没有变成平局原因就在材料约束这一项被赋予了 0.45 的权重它不是一个边角小项而是主榜名次的主发动机。材料约束考的也不是“会不会写代码”而是模型能不能在给定材料里找到事实、把原句和结论对上、并且在材料没写的地方不乱补。这个能力放在真实开发里很常见读接口文档、对照错误码、解释日志、从需求单里抽取兼容条件任何一步都可能因为“引用错一句”或“补了一个不存在的前提”而把后续代码带偏。所以原始结论可以概括成一句代码执行决定下限材料约束决定分水岭。Claude Sonnet 4.6 的 94.5 说明它在这一项上把引用和改写控制得比较稳文心一言 4.5 的 58.5 则说明它在同一套口径下丢了大量过程分。要复现这个分差不必先复现整个榜单只要把材料约束抽成一次两轮对照跑。1.2 94.5 与 58.5 的单项差怎么落到 53.83 的主榜单项 94.5 对 58.5表面差 36 分原文里主榜被压到 53.83极差超过 33 分。这里不要急着把两个数字直接相减后当成全部原因因为主榜是多因素加权后的结果材料约束只是权重最高、最容易放大差异的那一项。真正值得亲手验证的是当题面、材料、引用要求、温度全部固定只换模型 id两轮回答会在哪些维度开始分叉。如果第一轮 Claude Sonnet 4.6 在“引用原句”和“无幻觉”上扣分很少第二轮文心一言 4.5 在同样位置频繁扣分那分差来源就比较清楚反过来如果两边都能引对但文心那边把材料里的条件改写成另一个意思问题就落在改写克制上。这个过程比只看榜单分数更有意义因为它能告诉你分差不是玄学而是具体回答里一句一句累积出来的。1.3 复现前先把两套 Key 合成一套原文榜单只给了分数和结论没有给申请 Key 这一步。要自己跑对照最省事的做法不是去两个平台分别注册、分别记额度、分别处理 Base URL而是把两边都接到同一套 API 通道上。打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 注册后创建 YOUR_API_KEY然后在 Codex、Python 客户端或任意支持 OpenAI 兼容接口的 HTTP 客户端里把 Base URL 填成 https://taotoken.net/api。注意这里不是官网首页地址也不要画蛇添足加 /v1。同一把 Key 跑第一轮时模型 id 选 Claude Sonnet 4.6 对应的那条跑第二轮时只把模型 id 换成文心一言 4.5 对应的那条。其他参数包括 system prompt、材料文本、温度、最大输出长度、评分表全部不动。这样你看到的差异才更接近材料约束本身而不是因为渠道不同、Key 不同、请求格式不同引入的噪声。2. 同一把 YOUR_API_KEY 跑两轮TaoToken 上的 Claude 与文心模型准备2.1 打开官网注册并创建 Key先处理凭证。打开 TaoToken 注册并登录进入控制台里的 API Keys 页面创建一把 Key。本文所有配置都用占位符 YOUR_API_KEY你不要把真实 Key 写进公开仓库也不要贴到截图里。创建完成后Key 只放在环境变量或本地配置文件里请求时由客户端读取。注意官网落地页只用于注册、创建 Key、看模型广场、看用量。真正填进工具的 Base URL 是 https://taotoken.net/api末尾不要带 /v1也不要和官网首页混用。2.2 模型广场里确认两个模型 ID模型 id 不要凭记忆写也不要用别人博客里的旧字符串。打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 进入模型广场搜索 Claude Sonnet 4.6 与文心一言 4.5复制当时列表里给出的模型 ID。本文为了可复制用 YOUR_CLAUDE_MODEL_ID 和 YOUR_ERNIE_MODEL_ID 作为占位符你实际跑的时候把这两个位置替换成模型广场里的真实 ID。如果模型广场里同一系列有多个版本优先选与你复现目标一致的条目。不要自己加日期后缀、不要猜命名规则、不要把标题里的展示名直接当成 API 的 model 字段。材料约束对照跑最怕这种小错误因为第一轮一旦报“模型不存在”你会误以为是通道问题其实是模型 id 抄错了。2.3 落地页和 Base URL 不要混这一步经常被写乱最好用表格分清。官网地址是给人点的用来注册、拿 Key、看模型和看用量Base URL 是给程序填的用来发请求。两者长得像但用途完全不同。用途地址是否带 UTM是否加 /v1注册、创建 Key、看模型广场、看用量https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end是否填进 Codex、Python 客户端、HTTP 客户端的 Base URLhttps://taotoken.net/api否否把官网首页填进 Base URL 会报错把 /api 后面再加 /v1 也可能导致 404。记法很简单浏览器里打开的是带 utm_source 的落地页代码里写的是 https://taotoken.net/api。3. 材料约束题面自己写严格引用、避免幻觉的评分口径3.1 一份可复用的材料约束 prompt材料约束不是让模型自由发挥而是把它按在材料上回答。你可以选一段 800 到 1200 字的材料例如接口变更说明、错误码表、需求评审记录或一段技术公告。然后写一个 system prompt把引用规则说死每个结论后面必须附材料原句和段落编号材料没写的内容统一回答“材料未提及”不允许用外部知识补全数字、专有名词、否定词不能替换。user prompt 里放材料正文和问题列表。问题不要太多5 个左右即可但要覆盖三类直接事实、条件变化、数字与例外。这样评分时能看出模型是“没找到原文”还是“找到了但改写了原意”。两轮都使用同一份 prompt只换模型 id这是对照跑成立的前提。3.2 100 分评分表引用、覆盖、幻觉、改写评分表可以按四个维度拆。引用准确占 30 分看原句能不能在材料中定位数字和专名有没有被改动覆盖完整占 25 分看关键条件、例外和数字是否答到无幻觉占 25 分材料外事实、把推测写成结论、编造来源都扣分改写克制占 20 分允许压缩表达但不能替换专有名词或改变条件方向。维度分值判定要点引用准确30原句可在材料中定位数字、专名、否定词不变覆盖完整25关键条件、例外、数字、前后关系都答到无幻觉25没有材料外事实没有把推测写成材料结论改写克制20可压缩但不能改变原意或替换专有名词这套评分表不是为了复刻官方主榜而是为了让你在两轮回答里定位差异。Run #156 的 94.5 和 58.5 是榜单结果你手里这两份回答才是过程证据。3.3 两轮只换模型 id其他参数冻结第一轮把 model 设成 YOUR_CLAUDE_MODEL_IDtemperature 设 0其他采样参数尽量固定messages 完全一致。第二轮把 model 换成 YOUR_ERNIE_MODEL_ID其他一字不改。不要第一轮用长 system prompt第二轮换成短 prompt也不要第一轮要求引用原句第二轮只要求总结。那样跑出来的差异没有意义。如果你用 Python 客户端建议把请求函数封装成只接收 model 参数如果你用 Codex建议复制一份配置或在请求里显式指定模型。所有对照跑的共同原则是通道相同、Key 相同、Base URL 相同、题面相同唯一变量是模型 id。4. Codex 与 Python 客户端配置把请求打到 https://taotoken.net/api4.1 ~/.codex/config.toml 的 model_provider 与 base_urlCodex 侧可以自定义 provider。打开或新建 ~/.codex/config.toml把 provider 指向 TaoTokenBase URL 写 https://taotoken.net/api。模型 id 先填第一轮要用的占位符实际替换成模型广场复制来的值。model YOUR_CLAUDE_MODEL_ID model_provider taotoken [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY wire_api chat然后在终端里设置环境变量。Key 从 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 创建不要写死在 config.toml 里。export TAOTOKEN_API_KEYYOUR_API_KEY提示Codex 这里不要套 ANTHROPIC_* 变量。它是另一套配置体系Base URL 仍然是 https://taotoken.net/api末尾不要加 /v1。4.2 环境变量与单轮请求示例如果你用 Python 客户端OpenAI 兼容写法更直观。下面只展示单轮请求第二轮把 model 改成文心对应的 ID 即可。注意 base_url 仍然是 https://taotoken.net/api不要写成官网首页也不要加 /v1。import os from openai import OpenAI client OpenAI( api_keyos.environ[TAOTOKEN_API_KEY], base_urlhttps://taotoken.net/api ) system 你只能依据提供的材料回答。 每个结论后面必须附上材料中的原句和段落编号。 材料没写的内容统一回答“材料未提及”。 不要补充外部知识不要改变数字、专有名词和否定词。 user 材料 把 800-1200 字的材料粘贴在这里 问题 1. 材料中提到的核心结论是什么 2. 哪些条件会改变结论 3. 哪些数字是原文明确给出的 4. 哪些例外情况被单独说明 5. 哪些问题材料没有回答 输出格式 - 结论 - 引用原句 - 段落编号 resp client.chat.completions.create( modelYOUR_CLAUDE_MODEL_ID, temperature0, messages[ {role: system, content: system}, {role: user, content: user} ] ) print(resp.choices[0].message.content)4.3 第二轮只改 model 字段第一轮跑完把同一段代码里的 model 从 YOUR_CLAUDE_MODEL_ID 改成 YOUR_ERNIE_MODEL_ID其他参数保持原样。不要顺手调 temperature也不要因为第一轮回答太长就换 prompt。材料约束对照跑的价值就在于把变量压到只剩模型 id这样你才能判断扣分发生在引用、覆盖、幻觉还是改写。如果客户端支持保存请求日志建议把两轮的原始请求和原始响应都落盘。评分时不要凭印象直接对着回答逐条核对。尤其是数字、条件词、否定词这三类只要改了一处就可能把材料约束的分数拉低很多。5. 对照失败样例引用错和改写错要分开记5.1 引用原文却答错位置问题在检索不在模型有些回答看起来很流畅也引用了原句但段落编号对不上或者引用的句子无法支撑前面的结论。这类失败不要简单归为“编造”它更可能是检索和定位问题。评分时在“引用准确”里扣分同时记录是编号错、原句截断错还是把相邻段落混在一起。如果 Claude Sonnet 4.6 这一栏引用准确扣分少文心一言 4.5 这一栏扣分多而两边覆盖完整差不多那分差更可能出在定位材料、对齐原句这一步。这个判断比你直接看总分更有用因为它告诉你下一轮该加什么约束。5.2 材料没写却说“根据材料”这是幻觉扣分另一种典型失败是材料里根本没有的内容回答却写成“根据材料可知”。比如材料只说明某条件在版本 A 下成立回答补充了“版本 B 也适用”材料没有给出价格回答补了一个行业常见值材料只写了限制回答改成了建议。这些都要落在“无幻觉”和“改写克制”里扣分。文心一言 4.5 在 Run #156 里材料约束只有 58.5说明它在某项口径下丢分明显。你自己复现时不要只记“它更低”要具体到哪一条回答把材料没写的内容说成了材料结论。Claude Sonnet 4.6 的 94.5 也不是满分如果它出现引用位置偏差同样要记录。5.3 用一张表记录两轮扣分跑完两轮后把评分表填成对照表。不要只写总分要把每个维度和典型失败样例都写下来。下面这张表可以直接照搬。轮次模型 ID引用准确覆盖完整无幻觉改写克制总分典型失败样例第一轮YOUR_CLAUDE_MODEL_ID第二轮YOUR_ERNIE_MODEL_ID如果引用准确和无幻觉加起来差了 30 分以上基本可以判断分差主要出在“有没有按材料说”和“有没有乱补”。如果引用准确接近但改写克制差很多那问题更像是“读到了但转述变味”。Run #156 的单项 94.5 与 58.5 只是一个结果这张表才解释结果。6. 跑通后的 401/404/模型不存在排查6.1 401 先回官网看 Key 是否创建成功401 一般不是模型问题而是凭证没有正确带上。先回 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 控制台确认 API Key 是否创建成功再检查环境变量名是否和配置文件里一致。比如 Codex 配置里写的是 TAOTOKEN_API_KEY终端里却 export 成另一个名字请求自然会被拒绝。还要注意不要把官网落地页的 UTM 参数复制到 Base URL 里。Base URL 只写 https://taotoken.net/apiKey 才负责身份识别。两者混在一起轻则 401重则请求路径完全不对。6.2 404 多半是 Base URL 多写了 /v1404 最常见的来源是 Base URL 画蛇添足。TaoToken 这里填 https://taotoken.net/api末尾不要加 /v1。如果你在客户端里写成了 https://taotoken.net/api/v1或者把官网首页填进去请求就可能落到错误路径。先检查这一项再检查客户端是否自动追加了路径。注意环境变量 ANTHROPIC_BASE_URL 属于 Claude Code 那套配置不要套到 Codex 或普通 OpenAI 兼容客户端上。本篇的 Codex 和 Python 示例都只认 https://taotoken.net/api。6.3 模型不存在就去模型广场复制 ID模型不存在时先不要去改 Base URL。打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 模型广场重新搜索 Claude Sonnet 4.6 和文心一言 4.5复制列表里的模型 ID。不要手写日期后缀不要把展示名当 ID也不要用其他平台的历史字符串。以模型广场当时列表为准最稳。如果同一模型有多个渠道或版本选与你复现目标一致的那个。两轮对照跑只换模型 id所以第一轮和第二轮的 ID 都要从模型广场确认不能一轮用列表里的值另一轮用记忆里的值。7. 对账与下一步模型对话、Coding Plan、创建 Key7.1 在模型对话里用同一把 Key 发测试消息两轮跑完后可以先去 TaoToken 模型对话 用同一把 Key 发一条测试消息确认模型 ID 和 Base URL 没串。这个动作能帮你排除“请求发错通道”的可能尤其是你同时改了 Codex 配置和 Python 脚本时很容易把一边的模型 id 复制到另一边。7.2 长期跑对照看 Coding Plan 与用量如果你打算把材料约束做成日常回归比如每周换一段材料、固定两个模型跑一轮可以打开 Coding Plan 看套餐是否够用。用量和调用记录回控制台看Key 在 控制台 API Keys 创建。不要凭感觉猜额度跑对照最怕跑到一半中断。7.3 接入文档与创建 Key 入口如果之后要把这套对照链路接到 Claude Code环境变量和配置字段对照见 Claude Code 接入文档。但记住Claude Code 只是执行工具材料约束的题目、引用要求和评分表仍按本篇自己写。通道只保证同一把 Key、同一个 Base URL、同一套请求格式分数差仍会落在模型怎么引用、怎么克制改写上。跑完第一轮后先回 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 控制台确认这次调用有没有记上账再复制模型广场里的第二个模型 ID 跑第二轮。两轮失败样例对照完你就能判断 Run #156 那个超过 33 分的极差主要出在引用定位、覆盖遗漏还是材料没写却硬补。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →