【面试题】AI测试相关题
1. 怎么理解「AI 赋能测试」和传统自动化有什么区别对AI赋能测试的理解AI赋能测试是将大语言模型、机器学习等AI能力嵌入测试全生命周期替代或辅助测试中的认知类、生成类、分析类、决策类工作核心目标是提升测试效率、扩大覆盖边界、降低对人力经验的依赖最终提升质量保障的投入产出比。它不是单一工具而是覆盖需求评审、用例设计、脚本开发、缺陷分析、质量评估全链路的能力体系本质是让测试从“人力执行”走向“智能辅助人把关”的新模式。与传统自动化的核心区别维度传统自动化测试AI赋能测试核心能力按预设脚本确定性执行严格遵循代码逻辑无自主判断具备生成、理解、推理、归纳能力可处理非结构化、模糊的输入覆盖范围仅覆盖执行环节接口、UI、性能的自动执行覆盖全流程需求分析、用例设计、脚本生成、缺陷定位、质量评估、报告生成维护成本需求变更后脚本需人工逐一修改维护成本随迭代指数上升可基于变更需求自动更新用例与脚本维护成本大幅降低适配敏捷迭代场景边界只能测已知、固定的场景无法覆盖未知、模糊的边界可自主推导边界、异常、隐性场景扩展测试覆盖的广度输入要求必须是结构化的、明确的步骤与断言可处理非结构化输入PRD文档、自然语言需求、日志、缺陷描述价值侧重替代重复人工执行提升回归效率解放人力替代脑力劳动设计、分析、梳理提升测试设计质量与决策效率2. 大模型在测试里一般用在哪些环节大模型的价值贯穿测试全生命周期按测试流程落地场景如下需求阶段前置提效降低返工需求歧义识别、逻辑矛盾校验、可测试性分析自动输出需求评审意见拆解需求点、梳理业务规则、提取测试范围输出测试大纲。设计阶段批量生成补全覆盖基于PRD/接口文档批量生成功能测试用例、接口用例、边界异常场景自动生成测试数据含边界值、异常值、脱敏业务数据设计测试方案、梳理测试风险点、输出测试计划。开发阶段降本提效降低门槛自动生成单元测试、接口自动化、UI自动化脚本支持多语言多框架代码评审识别测试代码的逻辑漏洞、不规范写法、性能问题脚本调试分析报错日志给出修复建议辅助定位脚本问题。执行与分析阶段智能定位加速闭环自动分析测试失败日志、异常堆栈定位失败根因生成初步缺陷描述缺陷自动分类、分级推荐修复责任人辅助缺陷管理性能测试结果分析识别瓶颈点给出优化建议。运维与沉淀阶段知识沉淀持续优化自动生成测试报告、质量分析报告、版本风险评估沉淀历史缺陷、测试经验构建测试知识库辅助新人上手。3. 什么是幻觉Hallucination对测试工作有什么风险幻觉的定义幻觉是大模型的固有特性指模型生成的内容看似逻辑通顺、表述合理但实际上不符合客观事实、违背真实业务规则、编造不存在的信息或逻辑错误。主要分为两类事实性幻觉编造不存在的接口、字段、功能点、业务规则无中生有逻辑性幻觉推理过程错误、因果倒置、场景推导不符合真实业务逻辑。对测试工作的核心风险测试用例失效直接导致漏测/误测生成需求中不存在的功能点遗漏真实的核心场景编造错误的预期结果导致用例执行后无法正确判断对错直接动摇测试的准确性根基。自动化脚本不可用浪费研发资源生成不存在的API、方法、参数脚本无法运行逻辑断言错误导致执行通过但实际功能异常出现“假绿”误导版本质量判断。缺陷分析误导拉长排障周期编造错误的根因分析、错误的问题定位引导排查方向偏离反而增加问题解决的时间成本。质量防线失守引发线上事故测试本身是质量把关环节如果完全依赖AI输出、不经人工审核会导致测试本身不可靠质量防线形同虚设最终把问题漏到线上。合规与数据风险生成不符合安全规范的测试数据、编造合规规则导致测试过程违反数据安全、隐私保护要求。核心结论AI是测试辅助工具不能替代人的最终把关幻觉是固有风险必须通过人工评审、RAG知识库校验、多轮验证来管控。4. Prompt、RAG、Agent、Tool、MCP 分别是什么结合测试场景五个概念的定义与测试中的作用如下Prompt提示词是用户输入给大模型的指令、问题、上下文等所有输入内容是引导模型输出的最直接方式。测试场景作用通过编写测试专用prompt让AI生成符合要求的用例、脚本、分析报告是AI辅助测试的基础交互方式。RAG检索增强生成是一种大模型落地技术先从外部知识库文档、数据、历史记录中检索相关信息再把检索结果和问题一起输入给模型让模型基于真实资料生成答案。测试场景作用把PRD、接口文档、历史用例、业务规则接入RAG让AI生成的用例、脚本严格贴合真实业务大幅减少幻觉提升输出准确率。Agent智能体是具备自主规划、多步推理、工具调用能力的大模型应用形态能自主拆解复杂任务、调用工具、分步执行并修正结果而非单轮问答。测试场景作用实现自动化测试全流程闭环比如“读取PRD → 生成测试用例 → 生成自动化脚本 → 执行测试 → 分析失败原因 → 生成测试报告”全程自主完成。Tool工具是大模型可调用的外部能力用于弥补模型自身的能力短板计算、实时信息、实际操作、数据查询等。测试场景作用让模型调用接口测试工具、数据库查询工具、日志分析系统、缺陷管理平台、CI/CD流水线等实现从“生成内容”到“实际执行”的跨越。MCPModel Context Protocol模型上下文协议是一套开放的标准化协议定义了大模型与外部工具、数据源之间的统一交互规范让不同工具、数据源可以无缝接入大模型无需逐个定制开发。测试场景作用通过MCP可以快速对接测试平台、Jira、Jenkins、测试知识库等系统让AI Agent可以标准化调用各类测试工具与数据降低集成成本。5. 什么是 HITL人在回路为什么测试场景必须坚持HITL的定义HITLHuman-in-the-Loop人在回路是一种AI应用模式AI负责处理流程中的重复性、标准化环节输出初步结果而关键决策、审核、纠错、兜底环节必须由人参与人是最终的责任主体和质量把关者形成“AI辅助 → 人审核修正 → AI迭代优化”的闭环。测试场景必须坚持HITL的核心原因质量容错率极低必须有人兜底测试是产品上线前的最后一道质量防线一旦出错会直接导致线上事故、资损、用户投诉容错成本极高。而AI存在幻觉、逻辑漏洞完全自动化的测试不可信必须有人做最终验收。测试强依赖隐性业务经验很多测试规则、边界场景、历史踩坑、业务隐性逻辑没有写在文档里是团队的经验沉淀。AI无法完全掌握这些隐性知识只有资深测试人员才能补全这些高价值场景。测试需要风险权衡与决策测试不是非黑即白需要结合项目周期、影响范围、用户量级、业务优先级做风险判断哪些场景必须覆盖哪些可以放宽哪些可以后置。这种权衡决策必须由人来做AI无法承担决策责任。合规与问责要求产品质量责任必须可追溯、可问责最终责任人必须是人。完全由AI输出的测试结果出现质量问题时无法界定责任不符合企业质量管理与合规要求。持续优化AI效果的必要环节人的审核与修正可以反哺AI模型、优化prompt、补充知识库形成“人纠错 → AI变好 → 人更省心”的正向循环逐步提升AI的准确率。测试领域的典型人在回路节点用例评审、脚本审核、缺陷确认、上线质量决策。6. Token 和上下文窗口是什么对测试文档处理有什么影响基础定义Token大模型处理文本的最小单位中文中1个汉字约对应1-2个token英文中1个单词约对应1个token。模型的输入、输出都按token计量直接影响调用成本、响应速度。上下文窗口Context Window大模型单轮对话能处理的最大token总量包含输入内容输出内容是模型的核心能力参数之一。超过窗口限制时模型会遗忘早期内容、截断输入或直接报错。对测试文档处理的核心影响长文档无法一次性全量处理几百页的PRD、全量接口文档、数万条历史用例通常远超普通模型的窗口上限直接全量喂入会导致信息截断、内容遗漏生成的用例覆盖不全、前后逻辑矛盾。信息密度决定输出质量如果文档包含大量冗余内容、格式噪音、无关信息会占用宝贵的窗口资源导致有效业务信息占比低AI抓不住核心需求输出的测试内容偏离重点。成本与效率的平衡大文档全量处理会消耗大量token调用成本高、响应速度慢尤其是批量处理多份文档时成本和耗时会显著上升。长上下文的“遗忘”问题即使是大窗口模型也存在“中间遗忘”现象文档中间部分的信息容易被忽略导致中间模块的测试用例覆盖度低、错误多。应对思路用RAG分块检索不直接喂全文档只检索与当前测试模块相关的内容精准输入模块化拆分按功能模块拆分文档分批次生成用例再人工汇总信息提纯先让AI提取文档核心需求点再基于提纯后的内容生成用例选型匹配处理超长文档时选用大窗口模型降低截断风险。7. 使用 AI 辅助测试时有哪些合规红线AI辅助测试的合规红线围绕数据安全、隐私保护、知识产权、质量责任、内容合规五大维度是不可突破的底线数据安全红线禁止将公司内部未公开的需求文档、接口文档、核心业务代码、架构设计、生产环境配置输入公域大模型如公版ChatGPT、免费在线AI工具敏感业务数据、核心系统参数必须在私有化部署模型或企业级合规模型内处理严禁数据出域。隐私合规红线严格遵守《个人信息保护法》等法规测试数据必须脱敏禁止将包含真实用户手机号、身份证、交易记录、生物信息的内容输入AI禁止用AI生成、扩散用户隐私数据测试用例中的用户信息必须为虚拟构造。质量责任红线不得以“AI生成”为由逃避质量责任所有AI输出的测试用例、脚本、报告必须经过人工审核对应测试人员为最终责任人上线决策必须由人做出AI分析结果仅作参考禁止AI全自动决定版本上线。知识产权红线不得将第三方有版权的文档、开源代码、商业测试工具源码未经授权喂入AI生成衍生内容AI生成的代码、文档需确认版权合规避免侵权风险。内容与安全红线禁止利用AI生成攻击脚本、渗透测试工具、违规测试方法用于非法用途安全测试、渗透测试的AI应用必须在公司授权范围内开展符合网络安全法规。审计可追溯红线AI辅助测试的输入、输出、操作过程需留痕支持审计追溯符合企业内控与合规要求。8. Cursor / Claude Code 里的 Rules 是干什么的Rules规则是AI代码编辑器中的全局、持久化的行为准则配置相当于给AI设定了一套固定的工作规范会在所有对话、代码生成、编辑操作中自动生效无需每次重复写prompt。核心作用结合测试场景统一输出规范保证团队一致性把团队的测试规范固化成Rules比如生成测试用例必须包含前置条件、操作步骤、预期结果按P0/P1/P2分级自动化脚本必须遵循Pytest/Playwright框架规范、命名规范、注释要求。无论新人老人生成的内容都符合团队标准减少对齐成本。约束角色与能力边界限定AI的身份和输出范围避免输出无关内容。比如“你是资深Python测试开发专家只输出接口自动化脚本不解释基础语法”“禁止使用已废弃的v1接口所有用例必须基于v2版本OpenAPI生成”。沉淀团队经验规避重复踩坑把历史踩坑、业务禁忌、最佳实践写入Rules比如“生成支付相关用例必须覆盖幂等、退款、对账场景”“注意测试环境不支持真实支付回调需用Mock模拟”。AI生成内容时自动规避已知问题减少低级错误。项目级差异化适配不同项目可配置不同Rules比如App测试项目、后端接口项目、前端UI项目各有一套规则AI自动适配对应项目的要求无需每次切换都重新说明。与单次Prompt的区别Prompt是单次、临时的只对当前对话生效Rules是全局、持久的所有对话自动遵循适合沉淀通用规范、团队标准二者配合使用Rules定通用底线Prompt定具体任务兼顾一致性和灵活性。9. 一个好的测试向 Prompt 应包含哪些部分好的测试Prompt核心是精准、具体、约束清晰输出可直接落地无需大量人工二次修改。标准结构包含6个核心部分角色设定明确AI的专业身份与背景让输出更贴合业务。示例你是拥有5年短视频产品测试经验的资深测试专家熟悉推荐Feed流、播放器、广告混排的全链路测试。背景与上下文交代测试对象、需求核心逻辑、相关约束避免输出脱离实际。示例当前测试短视频Feed流的下拉刷新功能核心逻辑下拉距离≥80px触发刷新防抖阈值500ms新内容插入列表顶部刷新失败保留原有列表。明确任务目标清晰说明要产出什么产物、完成什么任务不要模糊。示例针对该功能输出完整的测试用例覆盖正常、边界、异常、性能四类场景。输出格式与规范规定输出结构、粒度、分类标准直接产出可用格式减少人工整理。示例用例按P0/P1/P2分级每条用例包含用例标题、前置条件、操作步骤、预期结果用Markdown表格输出不要多余解释。约束与强制要求明确必须覆盖的点、禁止项、特殊规则补全隐性信息减少幻觉。示例必须覆盖快速连击、弱网超时、无新内容、刷新中切后台等异常场景不要编造需求中不存在的功能。补充参考信息可选补充业务规则、历史坑点、特殊逻辑提升输出准确率。示例注意iOS和安卓端逻辑一致刷新接口有频控10秒内重复请求只处理第一次。10. 你怎么评审 AI 生成的测试用例评审核心目标是防幻觉、保覆盖、提质量、可执行按“先粗筛→再对齐→补细节→终确认”四步开展重点关注6个维度评审六大核心维度需求一致性首要维度防幻觉对照需求文档检查是否有“无中生有”的功能点、逻辑幻觉与需求不符的直接剔除是否覆盖了所有需求点有没有遗漏核心功能、关键规则。场景完整性检查是否覆盖了完整的测试维度正常流程、边界值、异常场景、并发场景、兼容场景、安全合规重点排查是否只有正常流程缺失异常、边界、错误兜底等高价值场景。可执行性操作步骤是否清晰、可复现没有模糊描述预期结果是否明确、可验证避免“显示正常”“体验良好”等无法判断的表述。分级合理性P0/P1/P2优先级划分是否准确核心主流程、高频场景是否归为高优先级边缘、低频场景是否归为低优先级有无主次不分。业务合理性用例是否符合真实用户使用逻辑有没有违背业务规则、不符合常理的测试场景是否贴合项目实际比如环境限制、已知约束。精简无冗余有没有重复用例、无效用例避免过度测试同一场景是否拆分过细导致用例膨胀。评审流程闭环粗筛快速剔除明显幻觉、完全脱离需求的内容修正大方向需求对齐逐条对照需求点标记遗漏、多余项补全缺口经验补全补充AI没覆盖的隐性业务规则、历史踩坑场景、特殊异常细节校准统一格式、修正步骤与预期、调整优先级最终确认确认整体质量达到可执行标准同步沉淀优化点到prompt/Rules提升后续生成质量。11. PRD、OpenAPI、Rules、Skill 在测试里如何分工四者分别对应业务输入、技术输入、规范标准、能力封装四个层级各司其职共同构成AI辅助测试的完整体系分工如下1. PRD业务需求源头定义“测什么业务”本质产品需求文档描述功能逻辑、业务规则、交互流程、用户场景是业务层面的需求基准。测试中的定位业务测试用例的设计依据用来验证功能是否符合产品预期覆盖业务场景、交互逻辑、用户体验。2. OpenAPI技术契约标准定义“测什么接口”本质接口规范文档定义接口的请求参数、响应结构、错误码、鉴权方式、调用约束是前后端、测试三方的技术契约。测试中的定位接口测试、自动化脚本的设计依据用来校验接口逻辑、参数校验、异常返回、性能指标。3. Rules输出规范底线定义“按什么标准输出”本质团队通用的测试规范、代码规范、流程约束、安全红线是所有输出的通用标准。测试中的定位约束所有AI输出的格式、粒度、风格、底线保证不同人、不同项目的输出质量一致符合团队规范减少对齐成本。4. Skill标准化能力模块定义“按什么流程做事”本质针对特定测试场景的标准化工作流封装把最佳实践、prompt、工具调用、知识库整合在一起开箱即用。比如“PRD转功能测试用例Skill”“OpenAPI转自动化脚本Skill”“缺陷根因分析Skill”。测试中的定位可复用的测试能力组件不用每次重新写prompt、配环境直接调用Skill就能完成标准化任务沉淀团队最佳实践。四者的协作关系输入层PRD提供业务需求OpenAPI提供技术契约是测试工作的原始依据规范层Rules提供通用标准约束所有输出的格式、质量、底线能力层Skill封装具体测试工作流调用PRD/OpenAPI的信息遵循Rules的规范最终输出标准化的测试产物用例、脚本、报告。12. 需求未冻结产品要用 AI 批量生成用例你怎么推进核心思路不否定AI价值而是建立“分层生成、动态迭代、增量同步”的机制把AI的效率优势用在快速产出上同时管控需求变动带来的返工成本避免盲目全量生成导致大量返工。具体推进步骤如下1. 先对齐认知明确预期边界先和产品、团队达成共识需求未冻结阶段AI生成的是用例初稿/场景基线不是最终可执行用例不能直接用于测试执行AI能降低需求变更后的用例调整成本但不能完全消除返工频繁变动依然会有调整成本明确“需求冻结后再做最终评审固化”的节奏避免大家误以为生成完就一劳永逸。2. 需求分层差异化分批生成把需求按稳定程度分成三类差异化处理避免全量生成后大面积返工稳定核心需求已经评审通过、确认不会变更的核心流程、基础功能优先让AI生成完整、细化的测试用例作为基线提前固化这部分是提效的核心。待确认需求逻辑还在讨论、大概率会调整的模块只让AI生成测试点清单、场景框架覆盖大的测试维度不做步骤、预期的细化避免改一次全推翻。未明确需求完全没定、还在构思的功能暂不生成只梳理测试风险点等需求明确后再补。3. 建立增量同步机制适配动态变更每次需求变更只同步修改对应模块的需求文档让AI做增量更新只调整变动对应的用例不用全量重写大幅提升迭代效率。固定每日/每周的需求同步节点集中更新一次用例避免零散变更反复修改碎片化消耗精力。4. 前置质量把控减少无效返工生成前先用AI做需求歧义识别把模糊点、矛盾点先列出来推动产品澄清后再生成用例避免因为需求本身不清导致反复修改用团队Rules、历史用例规范约束AI输出保证格式、分级、粒度一步到位不用花大量时间做格式调整。5. 分级评审逐步固化核心稳定用例提前组织评审固化下来后续只做增量调整不随零散需求变动待确认模块用例需求正式冻结后再做细化和最终评审进入执行阶段。6. 沉淀优化持续提效把每次需求变更的用例调整经验沉淀下来优化对应prompt和Skill让AI越来越适配团队的敏捷迭代节奏逐步降低需求变动带来的调整成本。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →