800K 行 C/C++ 要重写成 Rust:Agent 大规模重构,真正的门槛在哪?
800K 行 C/C 要重写成 RustAgent 大规模重构真正的门槛在哪Google 昨晚放出新前沿模型 Gemini 4 Argon。Hacker News 的讨论帖 半天冲到一千三百多分、八百多条评论。跑分表自然是漂亮的DeepSWE v1.1 拿到 77.9%长视频理解 LVBench 91.7%单次输出上限从 64K 直接拉到 1M token。但评论区里被顶得最高的一类声音说的不是分数。有一位开发者只写了一句真正的大新闻不是这个模型而是 Google 内部已经在用它把 C/C 代码库往 Rust 上搬Zircon 内核 80 万行。公告里最容易被划过去的那一行关于迁移的那一段藏在公告中间很容易当成背景介绍一扫而过。里面写了两个尺度。一个是宽度从 re2、libgav1 这样的核心基础库也就是数万行的量级一路铺到 Fuchsia 的 Zircon 内核800K 行。另一个是深度。libgav1 是 Google 开源的 AV1 视频解码器原本已经有一份 Rust 移植版。Argon 的 Agent 做的事情是把手写的 SIMD 代码替换掉——大约 32K 行——办法是跑很多轮 profile-guided 实验去读编译器吐出来的输出然后写出编译器能自动向量化的安全 Rust。最终结果是一个内存安全的解码器比原来那份 Rust 移植版快 2.7 倍而且视频输出逐字节一致。「逐字节一致」这四个字比「快 2.7 倍」重要得多。改写不难证明「没改坏」才难让模型生成 Rust现在不是难事。难的是当这份 Rust 要替换掉一段已经跑了十年的视频解码逻辑时你怎么知道换上去以后输出的画面还是同一帧、同一个比特。所以真正的活儿分成了两半一半是生成一半是验证。公告里对后者只给了一句话——这些大规模改写要经过严格的自动化与人工审计、仿真测试和评审才会进入生产。这句话很轻但它是整件事的重心。一个团队能不能让 Agent 去动 Zircon 内核这种地方不取决于模型写代码有多快而取决于它有没有能力对等地造出一套「等价性证明」把新旧两份实现的输出逐字节比对把边界条件用仿真测试盖住再用审计去兜住那些测试没覆盖到的地方。改写规模可以有 80 万行验证的规模就必须也是 80 万行那个量级。少一个数量级风险就从「快」变成了「不知道哪里会炸」。HN 上有开发者把这条单独拎出来说如果核心 C 库真能成批地这么换那影响可比随便哪个「AI 重写 C」的项目大得多。底下紧跟着就有人求一句顺手把 or-tools 也办了吧那项目的构建系统折磨人很久了。为什么这次要把单次输出顶到 1M token公告里另一个数字是输出上限从 64K 提到 1M。这不是「上下文窗口变大」那种数字游戏。HN 上有人直接提出了疑问模型是一个 token 一个 token 往外吐的每一步都要接上此前全部内容上下文越长每一步就越慢越贵。那 1M 输出到底意味着什么往迁移这类任务上想就顺了。一次「读代码、改代码、跑测试、看结果、再改」的长轨迹本身就会生成几十万 token 的中间产物。轨迹足够长模型才有可能在一次任务里把一座小模块拆完、改完、验完而不是每改一处就断一次、重新把上下文喂一遍。代价也很直白。公告标的尝鲜价是每百万输入 token 2 美元、每百万输出 token 10 美元有读者把脚注翻了出来说尝鲜期之后会变成 4 美元和 20 美元。输入侧有个缓存的折扣命中缓存的输入 token 按输入价的 95% off 计费——对于反复读同一份代码库这种场景这一项比单价本身更能决定账单。一边是想让模型跑更长的轨迹一边是轨迹越长每一步越贵——这两个方向是拧着的。缓存折扣和「只在必要处展开长轨迹」本质上都是在给这对矛盾找平衡。放开的另一面是必须能被审计这次发布还有一层值得单独看它不是全量开放而是先给一批可信的网络安全防御者走一条叫 Fairwind Program 的通道。给这批人开的东西里网络安全相关的护栏是被去掉的。理由不绕要能自主地找漏洞、验证漏洞、打补丁就得先允许它做那些通常会被拦下来的事。配套的两组数字是在 CWE-bench v1 上以 68% 并列第一另外公告提到早期演示里它在一个全球医院都在用的医疗软件里翻出了一个此前前沿模型漏掉的高危漏洞。做这件事的是 Wiz通过一个叫 Scan for Good 的免费项目。同一份公告里还有一段话在讲 prompt injectionArgon 是它对间接提示注入最抗打的一版。放进长轨迹任务里看就懂了——Agent 越是要自己去读文件、调工具、跑命令外部内容里夹带一句恶意指令的机会就越多。能力开得越大这条防线越关键。能力放开、护栏拿掉、审计跟上这三件事必须同时成立。缺任何一个「让 Agent 去改核心库」都只是句口号。社区不买账的地方也值得记一笔评论区的分歧很实在。一类人盯着数字有读者翻出上一代 Flash 调整评测权重后掉分的事说这次的跑分要打折看也有人怀疑「每天发一版快照」的做法会不会变成挑日子、挑最好的那次报数。另一类人盯着能不能用模型在给可信防御者的通道里普通订阅用户短期内碰不到有人直接问那自己付的高档套餐意义在哪。还有一类人盯着价格尝鲜价 2/10、之后 4/20本质上跟对手的高档模型是同一条价格线。把这些合起来看公告想传达的和社区接收到的是两件事官方强调的是能力跃升社区先问的是「可信吗、能用吗、贵不贵」。这种温差本身就说明这轮竞争已经从「谁更强」挪到了「谁被验证过、谁被托管得起」。一个判断这次真正往前挪了一步的不是模型自己能写多少行 Rust。而是「让 Agent 动核心代码库」这件事第一次被摆到台面上并且带着一套规模不小的配套验证。它把一个老问题推到了前台当生成变得便宜瓶颈就从「能不能写出对的代码」变成了「能不能证明它是错的还是对的」。要跟住这条线光读跑分表没用。得自己拿一批固定任务去测——尤其是那种「读一个仓库、改一处、跑一遍测试」的长轨迹任务看模型在真实工程里跑第几步开始崩。如果要在多个模型、多个长轨迹场景之间做横向对比测试像 likeai520.cc 这类 API 中转可以省掉一部分逐家接入和验证的工作。工具会一直换但那条判断不会变能生成不等于能交付能生成加上能被审计才叫能交付。主要参考Gemini 4 Argon 官方公告、Hacker News 讨论帖id49913571、Google re2、Fuchsia、Google 前沿安全框架、Wiz、Rust 官网
上一篇/下一篇内容由系统自动关联
返回资讯列表 →