尧图精选

AI在芯片设计中的真实角色:从架构到先进封装的工程实践

🕒 发布时间:2026/10/2 22:36:13 📁 来源:尧图网络
1. 从画芯片这个说法说起AI到底在芯片设计里扮演什么角色AI设计芯片这个说法第一次听到的人多半会想象一个画面工程师对着屏幕说一句给我来一颗三纳米、功耗两瓦、跑大模型的SoC然后AI唰唰唰把版图吐出来。这个想象不能说完全错但它把一件分阶段、分层次、有大量人工判断夹在中间的事情压缩成了一个魔法按钮。我在实际接触芯片设计和EDA工具链的过程中越来越觉得更准确的比喻是AI不是那个替你画画的画家而是那个帮你调颜料、递笔、指出你这笔画歪了的助手偶尔还能替你画几笔草稿但最终签字的还是人。要理解这件事得先把芯片设计这四个字拆开。一颗芯片从想法到能流片大致要经过几个阶段架构定义、RTL设计、功能验证、逻辑综合、布局布线PR、物理验证、签核signoff最后交给晶圆厂制造再进入先进封装环节把它和别的芯粒拼在一起。每个阶段的抽象层级完全不同——架构阶段讨论的是这颗芯片要几个核、缓存多大、走什么总线RTL阶段写的是寄存器传输级的硬件描述代码布局布线阶段处理的是几千万个标准单元在硅片上的物理位置。AI在这几个阶段能做的事情、能带来的收益、以及带来的风险差别非常大。把它们混为一谈是讨论AI会不会取代芯片工程师时最常见的思维陷阱。我写这篇东西的目的不是给某个具体工具做评测而是想把AI进入架构、RTL、布局布线与先进封装这条链路按阶段拆开讲清楚每个阶段AI现在能做什么、背后的原理是什么、工程师的工作内容会怎么变、哪些能力反而变得更值钱。关键词里的AI、芯片、EDA、RTL、先进封装基本就是这条链路的五个锚点。适合谁看如果你是在校学生想知道要不要往这个方向走如果你是刚入行的数字IC工程师担心被替代如果你是做系统或软件的想理解芯片侧在发生什么这篇应该都能给你一些能落地的判断而不是空泛的AI是趋势。2. 架构阶段AI最像军师的地方也是最难验证的地方2.1 架构探索本质上是一个超大搜索空间问题架构定义阶段要回答的问题说白了就是一堆互相拉扯的取舍这颗芯片面向什么负载、算力目标多少、功耗预算多少、面积能接受多大、要不要留可扩展接口。这些参数之间不是独立的改一个往往牵动一片。比如你把NPU的MAC阵列从1024扩到2048峰值算力上去了但面积和功耗也跟着涨缓存带宽可能成为新瓶颈最后端到端性能提升可能远小于预期。这种设计空间探索DSE在传统流程里靠的是工程师的经验加一堆电子表格再配合架构级仿真器跑几个典型负载。AI在这里的切入点非常自然把架构参数当作搜索变量把性能、功耗、面积当作目标函数用强化学习或贝叶斯优化去搜。学术界和工业界都有不少工作在做这件事思路大同小异——训练一个代理模型surrogate model去近似昂贵的仿真然后用它来指导搜索把原本要跑几千次的仿真压缩到几百次。这背后的逻辑是架构级仿真是整个流程里最慢的环节之一一次完整的负载仿真可能要几十分钟到几小时你不可能穷举。代理模型学的是参数到指标的映射学得够准就能在它上面快速试错。但这里有个必须说清楚的边界AI搜出来的架构方案是在给定约束和给定负载下看起来最优的方案不是一定正确的方案。如果训练负载选得偏或者约束建模漏了某个真实场景AI会非常忠实地给你一个在错误目标上最优的答案。我见过讨论里有人把架构AI当成自动出方案这是危险的。它更像一个不知疲倦的军师能给你一堆候选和它们的权衡曲线但拍板的人必须理解这些候选为什么长这样。2.2 为什么架构阶段的AI落地比想象中慢一个反直觉的事实是架构阶段理论上最适合AI实际落地却比布局布线慢。原因有三。第一架构决策的验证周期太长一个架构选择对不对往往要等芯片回来跑真实负载才知道反馈信号极其稀疏AI最怕的就是这种奖励来得太晚的场景。第二架构阶段的数据很难标准化每家公司、每个项目的架构描述方式都不一样没法像图像那样搞一个统一数据集。第三也是最现实的架构决策牵扯太多非技术因素——市场窗口、客户承诺、IP授权、团队能力这些没法写进目标函数。所以现阶段更现实的用法是AI辅助做局部探索和敏感性分析而不是端到端自动架构。比如你想知道缓存从4MB加到8MB对目标负载的收益有多大让AI代理模型快速给你一条曲线比手工跑仿真高效得多。工程师的价值在这里不是被削弱而是被重新定位从手动试参数变成定义好搜索空间和目标函数然后审阅AI给出的权衡。提示如果你在做架构探索先把目标函数和约束写清楚再上AI。目标函数含糊AI只会更快地给你一个含糊的答案。3. RTL阶段AI写代码很热闹但验证才是真正的战场3.1 用大模型生成RTL能到什么程度RTL是用硬件描述语言Verilog、SystemVerilog、VHDL写的、描述寄存器之间数据传输逻辑的代码。近两年大模型在代码生成上的进展自然被搬到了RTL上。你给一段自然语言描述比如实现一个带背压的异步FIFO深度可参数化模型能吐出一段看起来像模像样的Verilog。这件事在演示里很惊艳但真正做过数字设计的人会立刻问三个问题功能对不对时序能不能收敛边界条件处理了吗我自己的判断是当前大模型生成RTL的能力大致相当于一个刚学完课本、没做过项目的学生语法基本对常见结构能写但一到跨时钟域、复位策略、流水线握手这些真正考验功力的地方就容易出隐蔽的bug。而且硬件bug和软件bug不一样软件bug跑一次就暴露硬件bug可能藏在某个极少触发的时序角落里等流片回来才炸代价是几百万到几千万。所以RTL生成目前最合理的定位是加速样板代码和重复结构的编写而不是替代设计者。真正让AI在RTL阶段有价值的其实是验证侧。芯片设计里有个不成文的说法验证的工作量占整个前端的一半以上。写测试平台testbench、造激励、覆盖各种corner case这些工作量大、重复性高、又极度依赖经验。AI在这里能做的事情包括自动生成定向测试、从规格文档里抽取验证点、辅助写断言assertion、甚至根据覆盖率报告推荐下一步该补哪些激励。这些方向的共同点是——它们不直接决定芯片功能但决定了你能不能放心地把芯片交出去风险相对可控收益又很直接。3.2 形式化验证与AI的结合点在哪形式化验证是用数学方法证明设计满足某些性质不依赖激励。它的痛点是状态空间爆炸稍微大一点的设计就跑不动需要人手动切分、加约束、写抽象模型。AI在这里的潜在价值是帮助做约束求解的启发式引导和证明失败的根因定位。当形式化工具报出一个反例counterexample人工去追这条波形为什么能走到这个状态往往要花很久。AI辅助的根因分析可以把这个过程缩短。不过我要泼一盆冷水形式化验证对正确性的要求是证明不是大概率对。AI的输出天然带概率性把它直接放进证明链路里要非常小心。更稳妥的用法是让AI做预处理和辅助最终的证明仍然由确定性引擎完成。这个边界如果搞混会出大问题。3.3 工程师在RTL阶段该补什么能力如果AI接管了越来越多的样板代码和测试生成RTL工程师的核心竞争力会往两个方向迁移。一是规格理解与架构落地也就是把模糊的产品需求翻译成精确的硬件行为定义这件事AI做不好因为它需要跟人反复对齐意图。二是调试与根因分析当AI生成的代码或测试出了问题能快速定位是设计错、约束错还是工具错的人永远稀缺。我个人的经验是越是自动化程度高的流程越考验人在工具出错时能不能兜底的能力。你把AI当同事就得有review它工作的能力否则就是把自己的判断权交出去了。4. 布局布线AI目前落地最扎实、也最容易被误解的环节4.1 为什么PR是AI的天然主场布局布线是把综合后的网表映射到具体工艺库的标准单元上决定每个单元放哪、怎么连。这是一个典型的组合优化问题规模巨大——先进工艺下一颗芯片几千万到上百亿个晶体管标准单元数量以千万计。传统PR靠的是几十年积累的启发式算法加大量手工调参工程师要反复迭代约束、跑工具、看时序报告、再调。这个流程慢、依赖经验、而且不同工程师做出来的结果差异很大。AI在这里落地扎实原因很直接目标明确时序、面积、功耗、拥塞可量化、反馈快跑一次PR几小时到一天比架构验证快得多、数据可积累每次流片的结果都是训练样本。强化学习被用来做布局决策图神经网络被用来做拥塞预测和时序预测这些都不是纸上谈兵已经有商业EDA工具把AI优化作为卖点。关键词里出现的EDA很大一部分热度就来自这个方向。一个具体的例子是布局阶段的拥塞热力图预测。传统流程里拥塞往往要等到布线阶段才暴露那时候再回头改布局代价很大。用AI在布局阶段就预测哪些区域会拥塞提前把单元挪开或加宽通道能省下大量迭代。这个用法之所以靠谱是因为它做的是预测建议最终决策和验证仍在确定性工具里完成。4.2 AI优化PR的三个现实约束第一泛化性。在一个工艺节点、一类设计上训练出来的模型换到另一个节点或另一种设计风格效果可能大打折扣。芯片设计的多样性远高于图像识别没有哪个模型能通吃。所以实际部署时往往要针对具体项目做微调这又需要数据和算力。第二可解释性。PR工程师需要知道工具为什么这么布局才能判断结果是否可信、出了问题往哪查。AI给出的方案如果是个黑盒工程师不敢用。这也是为什么很多落地工具选择AI建议传统引擎执行的混合模式而不是纯端到端。第三签核的确定性要求。最终流片前的时序签核、物理验证必须用确定性工具跑出确定结果不能有概率性。AI可以加速中间迭代但签核这一步的红线不能碰。4.3 一个容易被忽略的收益点减少人肉调参我接触过的PR工程师大量时间花在调工具参数上——这个选项开不开、那个阈值设多少。这些参数之间的相互作用极其复杂靠人试错效率很低。AI做参数自动调优auto-tuning是相对低调但很实在的收益点它不改变流程本质只是把人试参数变成机器搜参数工程师从调参工变成结果审阅者。这类应用风险低、见效快我觉得比AI全自动布局更值得关注。5. 先进封装AI的新战场也是被低估的复杂度来源5.1 为什么先进封装突然变得这么重要当制程微缩越来越接近物理和经济极限单靠把晶体管做小来提升性能的性价比在下降。于是行业把目光转向把多个芯粒chiplet用先进封装拼在一起用2.5D、3D堆叠、硅中介层interposer、混合键合hybrid bonding等技术让不同功能、不同工艺的芯片协同工作。关键词里的先进封装热度上升正是这个背景。它解决的核心问题是不是所有功能都值得用最贵的制程做把合适的部分用合适的工艺做再拼起来整体更划算。但先进封装带来的复杂度是惊人的。它不只是把两块芯片贴一起而是涉及跨芯粒的互连布线、热管理、信号完整性、电源完整性、机械应力、良率已知良好芯片KGD等一系列问题。这些问题跨越了传统芯片设计和封装两个原本相对独立的领域导致很多团队在组织上都要重新调整。5.2 AI在先进封装里能帮什么先进封装的优化问题和PR有相似之处但维度更多。互连布线要在有限的中介层面积上安排成千上万条跨芯粒连线同时考虑时序、串扰、热。热管理要在三维堆叠里预测热点因为中间层的芯片散热路径被堵住了。这些都可以用AI做预测和优化。比如用机器学习预测不同堆叠方案下的温度分布比跑完整的热仿真快得多能在早期快速筛掉明显不可行的方案。另一个有意思的方向是良率优化。先进封装的良率问题比单芯片复杂因为任何一个芯粒坏了、任何一处键合失效整个封装就废了。AI可以用来做缺陷预测和测试策略优化决定哪些芯粒值得放进封装、怎么测最经济。这类问题的经济价值极高因为先进封装的成本本身就很高。5.3 跨领域协作才是真正的难点我个人的观察是先进封装里AI的技术难度未必比PR高但组织难度更高。因为它要求设计团队、封装团队、热团队、测试团队坐在一起用同一套数据和模型说话。AI在这里的价值某种程度上是提供了一个共同语言——大家围绕同一个预测模型讨论比各说各的仿真报告高效。但这也意味着光有算法不够得有能把跨领域数据打通的基础设施。这一点往往比模型本身更决定成败。6. 工程师会怎么变被替代的、被放大的、被新造出来的6.1 哪些工作会先被压缩按我的判断最先被压缩的是高度重复、目标明确、反馈快的工作样板RTL的编写、常规测试激励的生成、PR的参数试错、封装方案的初步筛选。这些工作的共同点是AI能快速给出可用结果人只需要审阅。注意是压缩不是消灭因为审阅本身也是工作而且审阅需要的能力往往比执行更高。6.2 哪些能力反而更值钱第一是定义问题的能力。AI再强也得有人告诉它优化什么、约束是什么、什么算好。把模糊需求翻译成精确目标函数这个能力会越来越值钱。第二是跨层理解。当AI把单个环节做得越来越快瓶颈会转移到环节之间的衔接上——架构和RTL之间、设计和封装之间。能打通这些边界的人稀缺。第三是兜底和调试。工具越自动出错时越需要能深入底层定位的人。6.3 给不同阶段从业者的实在建议如果你是在校生别只学工具操作工具会变。把数字电路、计算机体系结构、时序分析这些底层原理学扎实AI只是换了个方式考你这些原理。如果你是刚入行的工程师主动去用AI工具但别依赖它给答案要养成它给的每个结果我都能验证的习惯。如果你是资深工程师你的经验正是训练和校准AI最宝贵的资产别把它当成会被替代的东西想办法把它沉淀成可复用的判断规则。7. 回到那个问题未来芯片会不会由AI画出来我的答案是会有一部分由AI画但画这个动作本身会贬值真正决定芯片成败的判断不会。芯片设计从来不是单纯的画图或写代码它是在无数约束下做取舍而取舍需要理解意图、承担后果、对结果负责。AI能极大加速取舍的探索过程能给出人类想不到的候选方案但它不承担后果也不真正理解这颗芯片是给谁用的、为什么这么设计。所以与其问AI会不会取代芯片工程师不如问当AI把执行层做得越来越快工程师的判断层能不能跟上。我见过太多团队工具越先进反而越依赖少数几个能拍板的人因为执行快了决策的密度和重要性都上升了。这大概就是AI进入架构、RTL、布局布线和先进封装之后半导体工程师这个职业最真实的变化——不是被替代而是被逼着往更高层次的判断上走。走得上去的人会比以前更值钱走不上去、只会执行的人压力会越来越大。这个分化其实在AI来之前就已经开始了AI只是把它加速了。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →