审计转大模型:抽样范围由重要性水平定,模型只扩样本
版权与内容来源声明本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容均在附表 A 中标注来源引用官方原文保持原样不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式也不对任何收益结果作承诺。转载请注明出处。第 1 章 审计不是「把凭证全看一遍」而是先定重要性水平外行对审计的想象是「把凭证从头到尾看一遍」真做过项目的知道这既不现实、也不符合准则。审计的第一步是回答错到多大才算事这条线定了看多少、看哪些才有依据。1.1 重要性水平一句话就是「错到多大算事」重要性水平人话讲就是错报含漏报单独或加总起来大到可能影响财务报表使用者做决策的那条线。《中国注册会计师审计准则第 1221 号——计划和执行审计工作时的重要性》2019 年 2 月 20 日修订第三条说如果合理预期错报单独或汇总起来可能影响使用者依据财务报表作出的经济决策通常即认为该错报是重大的对重要性的判断根据具体环境作出受错报金额或性质的影响判断是否重大看的是使用者整体共同的财务信息需求。所以它不是某个财务科目而是从使用者决策需求倒推出来的判断值。第五条写明对重要性的确定属于职业判断。1.2 由重要性往下派生两层名称一句话说明准则依据对应到 AI 项目财务报表整体的重要性整张报表的「影响决策线」第 1221 号 第十条项目级验收线错成什么样算不达标特定类别的重要性水平某类交易、账户余额或披露单独设的更严格线第 1221 号 第十条关键字段、关键客群的单独阈值实际执行的重要性低于整体重要性为未发现错报留余量第 1221 号 第八条、第十一条上线前主动收紧的内部阈值三层逐层收紧。第十条要求在总体审计策略中确定财务报表整体的重要性某类交易或披露的错报虽低于整体重要性、但合理预期会影响使用者决策时还要单独确定。第八条把实际执行的重要性定义为低于整体重要性的一个或多个金额目的就是把未更正和未发现错报的汇总数超过整体重要性的可能性降到适当低水平——说白了就是先自己留余量。第十四条还要求把这些金额以及确定时的考虑因素记进审计工作底稿不只要求得出一个数还要求把推导过程留痕。1.3 抽样范围是被推出来的不是拍出来的重要性往下走一步就是可容忍错报。《中国注册会计师审计准则第 1314 号——审计抽样》2010 年 11 月 1 日修订第十二条定义它是注册会计师设定的一个货币金额试图对总体实际错报不超过该金额获取适当水平的保证。该准则的官方应用指南2023 年 4 月 4 日修订把关系点破了可容忍错报是将实际执行的重要性运用到特定抽样程序。第十六条接着要求确定足够的样本规模以将抽样风险降至可接受的低水平。反过来读样本规模是结果不是起点。整条链是重要性水平 → 实际执行的重要性 → 可容忍错报 → 样本规模 → 评价结果是否提供合理基础模型只能介入「把候选项目从总体里捞出来」这一段。第 2 章 把审计抽样翻译成 AI 的抽样评测与线索召回审计抽样的价值不在「抽样」二字而在于它规定了看不到全量时怎么得出对全量有效的结论。AI 项目用评测集推线上表现本质是同一类问题。2.1 六个概念可以一一对上审计概念准则怎么说AI 里对应的东西总体 / 抽样单元前者是据以得出结论的整个数据集合后者是构成总体的个体项目第五条、第六条待检数据全集外加数一条算一条的单元口径审计抽样对总体中低于百分之百的项目实施程序使所有抽样单元都有被选取的机会第四条抽样评测、抽检不是全量跑一遍可容忍错报试图对总体实际错报不超过该金额获取适当水平保证第十二条可接受的漏检上限抽样风险根据样本得出的结论可能不同于对总体实施同样程序得出的结论第八条用评测集分数推断线上表现的偏差分层按共同特征通常为货币金额把总体划成子总体第十一条按金额或风险分层高风险层全查第四条那个「低于百分之百」是关键抽样的前提是不可能也不必看全量。2.2 抽样单元的口径必须先定死抽样单元人话就是「你数一条算一条的那个『一条』」。第六条只说它是构成总体的个体项目但实务里它是什么直接决定结论能不能用。一个具体的坑训练数据里「一条」是凭证行评测集里「一条」是整张凭证两边数字就没有可比性。判据是单元口径写进配置训练、评测、线上抽检三处引用同一项。2.3 样本规模由风险推不由「越多越好」推准则没规定必须抽多少条第十六条只给目标足够把抽样风险降到可接受低水平。翻成工程语言样本量是约束优化问题的解不是拍脑袋的常数。下面这份分层配置体现第十一条的思路高风险层不抽样、直接全查常规层才进入抽样。⚠️代码待验证strata:# 高风险层全查常规层按可容忍错报定样本量-name:大额异常候选rule:单笔金额 500000sampling:全查# 这一层不抽样逐条人工看-name:期末调整分录rule:记账日期晚于结账日sampling:全查-name:常规往来rule:单笔金额 500000tolerable_error:3150000# 可容忍错报 实际执行的重要性risk_level:可接受的低水平# 对应第 1314 号 第十六条sample_size:derived# 由可容忍错报与风险水平推出不写死注意最后一行方法留给人定口径留给配置固定。这是审计能力在 AI 项目里最直接的落点。第 3 章 为什么「召回率越高越好」在审计场景是错的很多讲 AI 落地的人都说「召回优先」。这话在多数场景成立搬到审计里却会出事。原因不在指标本身而在指标背后谁买单。3.1 多召回一条就是多一条线索要人看召回率人话就是全部真线索里被系统捞出来的比例。审计里的「捞出来」不是终点而是人工队列的入口。召回率每抬一点进队列的条数就跟着涨。而人工复核预算——一个复核人一天能认真看完的线索条数——是有限的。队列超过预算人会开始跳读实际漏检反而上升。3.2 准则已经给了优先级先保效果再谈效率第八条把抽样风险根据样本得出的结论可能不同于对总体实施同样程序得出的结论分成两类错误结论第一类控制测试里推断的控制有效性高于实际或细节测试里推断某一重大错报不存在而实际存在。这类影响审计效果可能导致发表不恰当审计意见注册会计师主要关注这类。第二类推断的控制有效性低于实际或推断某一重大错报存在而实际不存在。这类影响审计效率通常导致额外的工作。翻成 AI 的话第一类是漏检把真问题判成没问题第二类是误报把没问题判成线索。准则的态度是——漏检是硬约束误报是可以用人力消化的软约束。所以「召回率越高越好」是错的提高召回是在用误报换漏检而误报的价格就是人工工时。工时预算见底后继续堆召回整条链会失效。3.3 用人工复核预算反推阈值正确做法是反过来解给定每日人工复核预算找预算内漏检最小的阈值。策略漏检人工队列什么时候不能用只保高精度高短关键科目漏检代价高只保高召回低长队列超预算后人开始跳读实际漏检回升预算内最小漏检可控约等于预算预算内达不到要求时应先缩小总体而不是放宽漏检上限第三行是推荐解判据是双条件队列条数不超过每日复核预算且漏检不超过可接受上限。两条不能同时满足说明总体范围或分层方式有问题该回去改分层而不是继续调阈值。⚠️代码待验证defpick_threshold(scored_clues,budget_per_day,max_missed):# scored_clues: [(clue_id, score, is_true), ...]# 返回空列表 预算与漏检上限在当前总体下不可兼得应先改总体范围thresholdssorted({sfor_,s,_inscored_clues},reverseTrue)feasible[]fortinthresholds:queue_lensum(1for_,s,_inscored_cluesifst)missedsum(1for_,s,is_trueinscored_cluesifstandis_true)ifqueue_lenbudget_per_dayandmissedmax_missed:feasible.append((t,queue_len,missed))returnsorted(feasible,keylambdarow:(row[2],row[1]))返回空列表不是失败而是明确信号当前口径下这条链闭不上要先改分层或缩小总体。第 4 章 证据的充分性与适当性模型能给到哪一步第 3 章解决「捞多少」这一章解决「捞出来的东西算不算证据」。4.1 充分性是数量适当性是质量《中国注册会计师审计准则第 1301 号——审计证据》2022 年 12 月 22 日修订第六条和第七条把两个词分得很清楚审计证据的充分性是对证据数量的衡量受对重大错报风险评估的影响并受证据质量影响。审计证据的适当性是对证据质量的衡量即证据在支持审计结论方面具有的相关性和可靠性。官方应用指南里有一句必须记住仅靠获取更多的审计证据可能无法弥补其质量上的缺陷。这句话直接画出模型的能力边界。模型最擅长扩数量——把候选线索从全量里捞出来但「这条线索是否相关、是否可靠」是质量判断准则把它归给职业判断。4.2 证据可靠性有明确排序模型输出多在后段第三条给了一组判断审计证据可靠性的一般原则可以当成字段可信度分级表用。准则给的判断人话落到 AI 输出上外部独立来源获取的比从其他来源获取的更可靠外人给的比自家人写的硬外部回函、银行流水优先于内部台账相关控制有效时内部生成的比控制薄弱时更可靠走过审批链的比手改的硬带审批流的系统导出优先于手工表格直接获取的比间接获取或推论得出的更可靠亲眼看到的优于推出来的原文片段引用优于模型转述文件记录形式的比口头形式的更可靠从原件获取的比从复印、传真或数字化件获取的更可靠白纸黑字优于口头说明原始件优于转抄件扫描件优先于会议纪要原始 PDF 优先于二次转录文本按这张表看模型生成的转述天然属于「间接获取」和「数字化转化」那一档。它在证据链里位置靠后——可以当发现线索的索引但不能自己充当证明力最强的那份证据。4.3 模型输出止于线索定性必须回人第二十三条要求实施细节测试时注册会计师应当根据样本中发现的错报推断总体错报。「推断」是有方向、有假设、要担责的而第 1221 号第五条明确重要性的确定属于职业判断。两条合起来说明模型既拿不到「使用者是谁」这个语境也不承担「推断总体」的责任。所以模型输出只能停在「这里有异常线索」不能写成「这里存在重大错报」定性必须由人做。第 5 章 每条线索必须能回到底稿索引前四章解决「怎么捞、捞多少、算不算证据」这一章解决捞完之后能不能被查账。5.1 底稿索引是什么底稿索引人话就是「这条结论依据的是哪份底稿的哪一页」的那串地址。审计为什么对这件事较真因为第 1221 号第十四条要求把重要性金额以及确定时的考虑因素记进审计工作底稿——判断过程本身就是审计对象。更直接的是法规层面2026 年 6 月 26 日通过的《全国人民代表大会常务委员会关于修改〈中华人民共和国注册会计师法〉的决定》新增一条作为第四十五条要求会计师事务所加强对审计工作底稿和审计档案的管理保证真实、完整并明确这些底稿和档案应当存放在中国境内该决定自 2027 年 1 月 1 日起施行。截至 2026-10-02现行有效的仍是 2014 年修正的版本。对 AI 项目的启发很直接不能被第三方复跑、不能定位到原始记录的结论不算交付物。5.2 可回溯的最小字段集下面是最小字段设计。缺任何一个这条线索在审计语境里就不成立。⚠️代码待验证{clue_id:clue-2026q3-000137,source_doc:凭证扫描件/2026-08/记账凭证-000137.pdf,doc_hash:原始文件指纹用于验证版本,locator:{page:12,bbox:[210,340,480,372]},rule_id:金额与合同不一致,evidence_grade:外部独立来源 / 文件记录 / 原件,extracted_value:1240000.00,compared_value:980000.00,materiality_ref:整体重要性 4500000实际执行的重要性 3150000,verdict:null,reviewer:null,workpaper_index:应付账款/细节测试/批次-03}三个字段值得单说doc_hash证明线索指的是哪一个版本的底稿文件被替换过一次整条链就断了locator给出页码与坐标框复核人几秒内能定位原文materiality_ref把当时的重要性水平快照进来——第十二条允许审计过程中修改重要性不记下来旧线索的定性依据就无法回溯。5.3 回不到索引的线索直接丢判据只有一条但要不打折执行线索生成时如果拿不到source_docdoc_hashlocator就不进人工队列。复核人一旦发现一条查不到出处的线索就会开始怀疑整批。宁可少一条。这份是审计与评测的对照清单把「重要性水平 → 抽样范围 → 证据充分性」三段判据整理成一页可勾选的清单便于对照自己的项目。放在资料包里扫码即可获取第 6 章 把「定重要性、查证据链、写底稿」翻译成 AI 岗技能前五章讲方法这一章讲怎么把它翻译成招聘方听得懂的话。6.1 能力翻译表审计人真正值钱的不是「会填底稿」而是几件底层能力。审计里的动作对应的 AI 岗技能面试举证定重要性水平从使用者决策出发定义「什么算重要」目标定义与验收标准设计阈值从需求推导拿出一个你定的阈值讲清推导过程确定抽样范围由风险与容忍度反推样本量评测集设计、分层采样、样本量估算讲清样本量的推导路径与边界判断证据是否充分适当区分来源、形式、获取方式数据溯源与血缘、字段级可信度分级指出某条结论引用的原始记录与版本写审计工作底稿让结论能被第三方复核可复现实验记录、评测报告撰写提供一个别人能跑通复现的脚本这张表的价值在于它把「我做过审计」变成「我做过阈值推导、做过分层采样、做过结论留痕」。招聘方不关心你审过哪家公司关心你能不能把模糊需求变成可验收的口径。6.2 需要补的三块数据操作能把原始凭证、台账、导出表读进来并清洗。第 5 章那套字段设计落到工程上就是一次数据建模。评测与指标能说清召回、精度、漏检、误报之间的关系以及第 3.3 节「预算内最小漏检」的取舍。检索与评测集构建能造一批带标注的线索并保证训练集与评测集的抽样单元口径一致第 2.2 节。这三块都是审计经验能直接复用的不必先去啃论文。6.3 一个最小落地路径不要一上手就做大而全的知识库。挑一个总体边界清楚、能拿到原始文件的小科目把整条链走一遍写一份口径文件定义「一条线索」是什么对照第四条、第六条。用规则或检索把候选捞出来每条都带第 5 章那三个必填字段。用第 3.3 节那段脚本在复核预算内挑阈值。人工复核把定性结论写回原记录。拿复核结果反推总体错报写成能被别人复跑的评测报告。走完这五步你手里就有一份能拿去面试讲四十分钟的完整项目而不是一张课程证书。第 7 章 一条链什么时候算闭合判据清单7.1 六条可执行判据阈值可推导能说出阈值来自哪条重要性水平并写出推导过程做不到就回到需求侧重定重要性别在现场调参。口径一致训练、评测、线上抽检的抽样单元是同一个口径做不到就把口径抽成配置项统一引用。队列不超预算每日进人工队列条数不超过复核预算超了就缩小总体或重新分层别放宽漏检上限。线索可回溯每条线索能定位到原始文档、位置、版本指纹缺字段的直接丢弃。结论留痕人的定性结论写回同一条线索记录模型不得自行填写结论字段。变更走版本重要性水平或阈值调整后旧评测结果作废重跑并保留旧版本记录说明变化原因。第一条和第三条是这条链能不能闭上的决定因素任何一条不成立整条链就只能算「演示」。三个停止信号出现时都该先改设计而不是继续加模型队列连续多日超预算「无法回溯」的线索占比升高为提高召回而在放宽漏检上限。7.2 和责任新规对齐2026 年 6 月 26 日通过的修改决定新增了一项禁止行为注册会计师执行审计业务出具报告时未保持应有的职业怀疑且未履行必要的审计程序或者未获取充分适当的审计证据发表不恰当审计意见或者出具报告。同时罚款上限从现行法的违法所得五倍以下提高到十倍以下。该决定自 2027 年 1 月 1 日起施行截至 2026-10-02现行有效的仍是 2014 年修正的版本。这条新规的信号与本文结论一致法律审查的是「人有没有做必要的程序」不是「工具算出了什么」。引入模型不会转移责任反而让「程序是否留痕」更容易被检查——这正是第 5 章那套字段设计的价值。这份是本文的判据清单与字段模板把第 5 章的线索字段和这一节六条判据做成了可直接复制的模板文件。放在资料包里扫码即可获取附表 A本文引用事实与出处对照表事实出处文档名 发布方 链接本文位置重要性概念的内涵、判断根据具体环境作出、考虑使用者整体共同需求、对重要性的确定属于职业判断第三条、第五条整体重要性与特定类别重要性水平第十条实际执行的重要性的定义第八、十一条底稿记录要求第十四条可修改重要性第十二条施行日期 2019-07-01第十五条《中国注册会计师审计准则第 1221 号——计划和执行审计工作时的重要性》2019-02-20 修订财政部法规库 http://fgk.mof.gov.cn/tmp/2024/4/10/79a5a0ed-43da-4129-90eb-40006a9a79db.pdf第 1.1、1.2、4.3、5.1、5.2 节审计抽样定义对总体中低于百分之百的项目实施程序使所有抽样单元都有被选取机会第四条总体、抽样单元、分层、可容忍错报的定义第五、六、十一、十二条抽样风险定义与两类错误结论、主要关注影响审计效果的那一类第八条样本规模第十六条由样本错报推断总体错报第二十三条评价抽样是否提供合理基础第二十四条施行日期 2012-01-01第二十五条《中国注册会计师审计准则第 1314 号——审计抽样》2010-11-01 修订中国注册会计师协会官网「审计准则」栏目 https://www.cicpa.org.cn/ztzl1/Professional_standards/xxzztx/zyzz/sjzz/第 1.3、2.1—2.3、3.2、4.3 节可容忍错报是将实际执行的重要性运用到特定抽样程序《中国注册会计师审计准则第 1314 号——审计抽样》应用指南2023-04-04 修订中注协 https://www.cicpa.org.cn/xxfb/tzgg/202304/W020230410260829928436.pdf第 1.3 节审计证据的充分性是对数量的衡量、适当性是对质量的衡量第六、七条判断审计证据可靠性的一般原则第三条选取测试项目的方法应有效实现审计程序目的第十四条《中国注册会计师审计准则第 1301 号——审计证据》2022-12-22 修订中国注册会计师协会官网「审计准则」栏目 https://www.cicpa.org.cn/ztzl1/Professional_standards/xxzztx/zyzz/sjzz/第 4.1 节、第 4.2 节仅靠获取更多审计证据可能无法弥补其质量上的缺陷《中国注册会计师审计准则第 1301 号——审计证据》应用指南2019-03-29 修订中注协 https://www.cicpa.org.cn/ztzl1/Professional_standards/201904/W020210421547149412162.pdf第 4.1 节现行《注册会计师法》为 2014 年修正版1993 年通过、1994 年 1 月 1 日施行《中华人民共和国注册会计师法》2014 年修正全国人大常委会汕尾市财政局转载 https://www.shanwei.gov.cn/swczj/zwgk/0200/content/post_690221.html第 5.1 节、第 7.2 节2026 年 6 月 26 日通过修改决定、自 2027 年 1 月 1 日起施行新增禁止行为未保持应有职业怀疑且未履行必要审计程序或未获取充分适当审计证据发表不恰当审计意见或出具报告审计工作底稿与审计档案应存放在中国境内罚款上限由违法所得五倍以下提高至十倍以下《全国人民代表大会常务委员会关于修改〈中华人民共和国注册会计师法〉的决定》新华社受权发布中国新闻网转载https://m.chinanews.com/wap/detail/cht/zw/10648193.shtml第 5.1 节、第 7.2 节第 1301 号所属修订批次自 2023 年 7 月 1 日施行财政部《关于印发〈中国注册会计师审计准则第 1211 号——重大错报风险的识别和评估〉等准则的通知》财会〔2022〕36 号中国政府网 https://www.gov.cn/zhengce/zhengceku/2023-01/08/content_5735618.htm第 4.1 节附表 B术语速查表术语一句话解释在本文哪里用到重要性水平错报大到可能影响使用者决策的那条线第 1.1 节实际执行的重要性 / 可容忍错报前者为未发现错报留余量后者是它落到某个抽样程序上的金额第 1.2、1.3 节审计抽样 / 抽样单元前者对总体中低于百分之百的项目实施程序后者是数一条算一条的个体项目第 2.1、2.2 节抽样风险 / 漏检 / 误报抽样风险指用样本结论推总体可能推错漏检把真问题判成没问题误报把没问题判成线索第 3.2 节分层按共同特征把总体切成子总体第 2.1 节审计证据的充分性 / 适当性前者衡量数量后者衡量质量相关性、可靠性第 4.1 节底稿索引结论依据哪份底稿哪一页的那串地址第 5.1 节召回率全部真线索里被系统捞出来的比例第 3.1 节人工复核预算一个复核人一天能认真看完的线索条数第 3.1 节写在最后这篇用到的资料写这篇文章时把相关的官方文档和源码又翻了一遍顺手也整理了几份配套的东西大模型学习路线图从零基础到能自己动手做 Agent按阶段说明每一步该学什么、哪些可以先跳过《LangChain LangGraph MCP 智能体开发实战》视频课7 个模块从私有化部署、EmbeddingRAG 到 MCPAgent 全流程AI 大模型知识库在线可查Agent Skills 从入门到落地、Claude Skills 完全指南等专题按目录浏览即可640 套 AI 大模型行业报告 经典 PDF 书籍看行业落地案例和别人怎么做的时候用得上大模型零基础到精通教学视频跟着敲一遍比只读文档快得多资料是我自己整理的放在下面这个码上扫码即可获取添加时备注「AI」优先通过。资料按「先路线、再动手、最后查漏」的顺序整理好了建议先看学习路线那一份照着它挑一条适合自己当前基础的路径再往下看。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →