AI-900备考神器:用Python处理docx实现高效复习与批注
简介这是一份面向AI入门学习者与AI-900备考者的快速入门工具书系统梳理了人工智能基本概念、Azure机器学习、计算机视觉、自然语言处理、对话式AI等核心模块同时涵盖负责任的AI与AI技术特征适合希望短时间建立Azure AI知识框架的读者。资源为单个docx文档约2.31MB内容按六大部分组织包含理论讲解、案例分析与知识检查题可配合官方课程进行对照学习。已有880人浏览学习适合需要快速掌握考点、梳理知识脉络的备考人群。书中不仅详解了如何使用Azure机器学习创建工作区、计算资源与数据集还演示了通过可视化设计器和自动化机器学习训练、部署及测试预测服务的完整流程同时结合实际案例说明负责任的AI落地方式。目录结构清晰从基础概念到动手实践逐层递进每章末尾配有知识检查可边学边测、巩固理解。1. AI-900 快速入门工具书docx 比视频更适合备考的五个理由考 AI-900 的人通常有两个极端要么抱着官方学习路径从头看视频一个月后还在“机器学习”那节打转要么直接刷题背完 200 道题上考场遇到换皮题就懵。Azure AI Fundamentals 的难点从来不是技术深度而是概念覆盖广视觉、NLP、文档智能、知识挖掘、生成式 AI 全都要沾一遍每个知识域只有三五道题的份额。用视频备考的问题在于信息密度太低用 PDF 备考的问题在于没法在原文上做标注和批注。这时候一份能自由编辑的 docx 工具书反而是最优解可以把大纲重排成自己的复习结构、把每个服务的中文名和英文缩写并排标好、按自己的错误率反复调整考点优先级。这篇文不聊怎么报名、不背题库只讲一件事把 AI-900 的 docx 资料变成可检索、可标注、可批量整理的个人备考工作台。2. 把 docx 当成备考工作台样式、导航与批量整理2.1 为什么选 docx 而不是 PDF 或 Markdown 做工具书PDF 的优势是版式固定但 AI-900 备考资料恰恰不需要版式固定。你需要的是不断压缩、重排、删减第一轮读的时候要把“Azure OpenAI 属于生成式 AI 负载”这类句子划出来第二轮要把所有带“responsible”或“公平性”的内容聚合到一起第三轮想把做错的判断题统一移到文档末尾。docx 在 Word 里能做的操作PDF 大部分做不到改标题层级、拖动章节、用样式批量换字体颜色、插入批注、用导航窗格折叠无关章节。Markdown 是另一个常用选择但它有两个硬伤。一是表格和图片的处理在本地工具链里容易散二是大多数备考者最后还是要回归 Word 或 WPS 来打印和批注。docx 是这三个格式里唯一同时满足“可批量处理”“可人机协作编辑”“可无损打印”的选项。如果收到一份 AI-900 docx 资料第一件事不是从头读而是先把它的样式结构抽出来看看确认标题层级完整再决定怎么读。2.2 用样式层级重建文档结构从“从头读到尾”变成“按需折叠”拿到一份 AI-900 docx 工具书常见问题是标题用的是“加粗放大字号”而不是真正的 Word 标题样式。后果是导航窗格一片空白无法折叠也无法一键生成目录。常见做法是先用 Word 的“样式”面板把所有一级标题应用为“标题 1”知识域章节应用为“标题 2”服务介绍段落应用为“标题 3”。当文档有几十个标题时手动逐个改太低效。用 python-docx 可以批量处理下面这段脚本会把文档中所有“考点”开头的段落自动改成“标题 2”所有“服务”开头的段落改成“标题 3”并统一设置中文字体为微软雅黑。from docx import Document from docx.shared import Pt doc Document(AI-900快速入门工具书.docx) for para in doc.paragraphs: text para.text.strip() style_name para.style.name if text.startswith(考点): para.style doc.styles[Heading 2] for run in para.runs: run.font.name 微软雅黑 run.font.size Pt(14) elif text.startswith(服务): para.style doc.styles[Heading 3] for run in para.runs: run.font.name 微软雅黑 run.font.size Pt(12) doc.save(AI-900工具书_结构整理.docx)这段脚本的核心逻辑只有两件事按段落前缀匹配目标类型然后替换段落样式。注意para.style接收的是样式对象而不是字符串所以要用doc.styles[Heading 2]而不是Heading 2。字体设置必须遍历para.runs而不是设置para.font原因是每个 run 自带字体属性只设置段落级别无法覆盖已有 run。如果文档里的文本是用粘贴 PDF 产生的很可能会出现一个段落被拆成多个 run 的现象这时text.startswith()依然有效但run.font.name只对 run 生效不匹配的 run 会残留原字体需要配合for run in para.runs全部重置。2.3 用批注做三轮自测把错误沉淀回文档docx 的批注功能适合做“三轮复习法”。第一轮通读时只批注不懂的术语比如“Azure AI Search 的知识挖掘到底是什么场景”第二轮合上资料做判断把错误的考点用红色字体标出第三轮只看红色区域能复述的解释绿色。Word 的审阅窗格支持按作者筛选批注所以可以在每个知识域用不同作者名来区分复习轮次。双击批注可以跳转到原文配合导航窗格一个包含全部知识域的 docx 会变成一个可交互的复习地图。from docx import Document from docx.oxml.ns import qn import datetime doc Document(AI-900工具书_结构整理.docx) comment_text 第一轮不懂Azure AI Search vs Azure OpenAI 的区别 comment_element doc.paragraphs[10]._element comment_range comment_element.makeelement(qn(w:commentRangeStart), {}) comment_range.set(qn(w:id), 1001) comment_element.append(comment_range) comment comment_element.makeelement(qn(w:comment), {}) comment.set(qn(w:id), 1001) comment.set(qn(w:author), 第一轮) comment.set(qn(w:date), datetime.datetime.now().isoformat()) comment_text_element comment_element.makeelement(qn(w:p), {}) run_element comment_element.makeelement(qn(w:r), {}) text_element comment_element.makeelement(qn(w:t), {}) text_element.text comment_text run_element.append(text_element) comment_text_element.append(run_element) comment.append(comment_text_element) doc.save(AI-900工具书_批注.docx)这段脚本是直接往 XML 层插批注对象不依赖 Word 的宏功能。commentRangeStart决定批注锚定到哪个位置w:comment里的w:author决定作者名。需要注意w:id必须是字符串且全局唯一如果和已有批注冲突Word 打开时会提示修复。这个脚本适合在 Python 环境里跑也可以把逻辑保存成.py文件后用python batch_comment.py执行。2.4 表格参数化把知识域映射表变成可筛选清单AI-900 资料中大量内容是服务与场景的映射表比如“读取发票 → Form Recognizer”“分析客服对话 → Language Service”。手动维护这些表效率低而且 Word 表格在 docx XML 中是一段独立的w:tbl结构可以用 python-docx 直接生成。from docx import Document doc Document() doc.add_heading(AI-900 服务映射表, level1) table doc.add_table(rows4, cols3) table.style Table Grid headers [场景, 服务, 知识域] data [ [识别手写发票, Azure AI Document Intelligence, 文档智能], [检测图片中的物体, Azure AI Vision, 视觉工作负载], [做跨境电商评论摘要, Azure OpenAI, 生成式 AI], ] for i, header in enumerate(headers): table.rows[0].cells[i].text header for row_idx, row_data in enumerate(data, start1): for col_idx, cell_value in enumerate(row_data): table.rows[row_idx].cells[col_idx].text cell_value doc.save(AI-900_映射表.docx)生成表格后可以用 Word 的“排序”功能按知识域排布也可以把表格内容复制到 Excel 做筛选。注意table.style Table Grid确保表格有边框线否则生成的表格在 Word 里可能没有可见边框。这种表格文件的优势是可以直接做双向验证从场景反查服务或者从服务反查场景比线性阅读要快很多。生成的表格可以重新插入原 docx 的指定位置也可以单独作为附录册使用。3. AI-900 六个知识域的复习索引用判断题定位优先级3.1 一张表看懂 AI-900 考什么AI-900 的考纲按工作负载划分覆盖描述 AI 工作负载和责任、视觉、NLP、文档智能与知识挖掘、生成式 AI 几个模块。一套好的 docx 工具书应该具备一个可勾选的知识域索引表让每次复习都能看到“哪些域还薄弱”。下面是一张可直接复制到工具书里的参数化表格每一行对应一个考纲方向的服务代表和常见考点。知识域典型服务年度考纲通用名称常见考点优先级视觉工作负载Azure AI Vision图像分类、目标检测、OCR高NLP 工作负载Azure AI Language关键短语、情感分析、摘要、对话理解高文档智能与知识挖掘Azure AI Document Intelligence、Azure AI Search从文档提取键值对、索引构建中生成式 AIAzure OpenAI补全、聊天、嵌入、提示工程基础中负责任 AI监管、透明、公平、可靠与安全、隐私与安全六大原则的场景匹配高机器学习基础描述性Azure Machine Learning回归、分类、聚类、自动化 ML中偏易这张表的核心作用是帮助建立“服务 → 负载”的联想。考试中很多题不给服务名只给场景描述。比如题干讲“一家公司需要从手写表单中提取数据”能快速对应到文档智能而不是视觉靠的就是这张映射表反复看出来的条件反射。3.2 用判断题训练场景识别五道高频易错题AI-900 的选择题考的是判断而非实现所以训练材料用判断题比用多选题更高效。下面的五道题是资料里误判率较高的一组每道题都附上了判断依据。3.2.1 “OCR 属于文档智能负载”错误。OCR 把图片中的文字提取出来属于视觉工作负载。文档智能要处理的是“结构”比如发票里哪个字段是金额、哪个是供应商。区分点是输出是纯文本还是结构化数据。Azure AI Document Intelligence 也可以处理 OCR但在考纲里归属是文档智能。3.2.2 “文本分类和实体识别属于同一类 NLP 任务”正确方向但要细看。文本分类解决“这段文本属于什么类别”实体识别解决“人名、地名、时间在哪”。两者都属于 NLP 的“理解类”任务和生成类任务总结、翻译对应。如果题目给的是“从评论中提取产品名”属于实体识别。3.2.3 “回归问题可以用来预测明天是否下雨”错误。是否下雨是典型分类问题是/否回归输出的是连续数值比如降雨量毫米数或温度值。考试里经常用“是否为垃圾邮件”“欺诈与否”“下不下雨”来考分类用“预测销售额”“估计房价”来考回归。这个考点的核心是看输出的类型离散标签是分类连续数值是回归。3.2.4 “聚类算法适合做客户分群”正确。聚类是无监督学习在未知标签情况下把相似样本聚合。客户分群不需要事先确定标签所以用聚类合理。容易混淆的是“预测客户是否流失”有明确标签是分类不是聚类。3.2.5 “负责任 AI 的透明性原则要求所有 AI 决策完全公开算法细节”错误。透明性原则要求的是“记录并披露 AI 系统的功能、局限和对用户的影响”不是公开源代码或算法细节。考试经常会用“企业必须公开模型权重”这类绝对化表述来制造陷阱。看到“必须公开”“完全可解释”“绝对公平”这种绝对化说法要优先怀疑。3.3 把判断题的答案做成可折叠的隐藏文本复习时最好的状态是眼睛先看到题脑子里出答案然后再看解析。docx 可以用“字号设为 1 号 白色字体”把答案做成隐藏文本想看时选中文本换回黑色即可。Word 的“显示/隐藏编辑标记”可以快速切换这比在正文里直接写“答案正确”要更符合自测节奏。# 用 LibreOffice 命令行把答案区变为白色字体 # 注意这条命令适合把整个文件的隐藏文本渲染出来做二次校对 soffice --headless --convert-to pdf AI-900工具书_批注.docx上面的命令是 LibreOffice 的无头模式转换--headless表示不启动图形界面--convert-to pdf把 docx 转成 PDF。转换出来的 PDF 中白色字体默认会被嵌入如果打印机没注意色调会打出白字。常用来检查文档是否在别的阅读器下排版异常以及确认表格控件没有超出页面边界。4. docx 工具书排错指南打不开、样式错乱与 WPS 兼容4.1 双击文件提示“无法打开”或需要修复docx 本质是 ZIP 压缩包损坏时首先尝试用解压软件解压。如果解压后能看到word/document.xml说明 XML 层还是完整的问题大概率出在某个图片或嵌入对象上。# 备份原文件解压检查 XML 完整性 cp AI-900快速入门工具书.docx backup.docx mkdir docx_extract cd docx_extract unzip ../AI-900快速入门工具书.docx ls -la word/cp是备份防止接下来的操作破坏原文件。unzip解压后重点检查三点word/document.xml是否能被 XML 解析器读取、word/_rels/document.xml.rels里的关系引用是否存在、[Content_Types].xml是否为空。如果发现 document.xml 存在但 Word 打不开常见做法是用 Python 的 lxml 库解析该 XML 文件定位未闭合标签所在段落然后只修复那一处。from lxml import etree tree etree.parse(word/document.xml) root tree.getroot() print(root.tag)etree.parse会直接抛异常告诉你错误行号比如XMLSyntaxError: Opening and ending tag mismatch。拿到行号后用文本编辑器打开 document.xml定位到对应行检查w:p是否缺少对应的/w:p。这类问题往往是从网页复制内容时产生的空段落或嵌套表格最容易坏。4.2 导航窗格不显示标题等级如果打开 docx 后按CtrlF调出导航窗格发现内容一片空白或只有几个大标题说明资料内标题不是按 Word 样式做的而是手动加粗。解决办法是批量应用样式也就是 2.2 节中的脚本。如果不想写代码可以先用“开始 → 选择 → 选择所有格式类似的文本”把某个字体属性的标题一次性全选然后应用“标题 2”样式。注意 Word 只会对样式为“标题 1”“标题 2”等的段落生成导航条目手动加粗不算。4.3 在 WPS 里打开时文字位置整体右移或图片被截断不同 Office 实现尤其是 WPS 与 Microsoft Word 之间对 docx 的兼容存在细微差别最常见的是表格宽度和图片浮动的渲染差异。这里要提醒一个常见操作误区不要用 WPS 默认新建 docx 再粘贴内容粘贴时容易把网页格式连同 CSS 残留一起带入文档对象导致段落基线错位。建议在 WPS 中打开下载的 docx 之后通过“文件 → 另存为 → docx”重新保存一次利用保存过程重建内部结构往往能修复内容格式残留问题。如果出现表格超宽可以在 Word 的“布局 → 自动调整 → 根据窗口调整表格”中重置也可以在代码里对表格设置table.autofit True。图片截断则查看段落格式中的“行距”是否为固定值固定行距会把嵌入型图片压扁改成 1.5 倍行距或“最小值”可以解决。4.4 表格在手机上显示错位用手机版 Office 或 WPS 打开工具书时多列表格会被压缩看起来混乱。一个比较有效的做法是把重要映射表改造成“两栏布局”而不是“三栏以上”。比如“场景 服务”用两栏“场景 服务 知识域 优先级”改成两个两栏表避免表格直接溢出屏幕。如果必须保留大表用 Word 的“表格属性 → 选项”勾选“允许跨页断行”防止表格行在页面间被硬切。5. 把 docx 固化成个人错题本批注提取与 A/B 自测工具书的价值不只是“读”而是“用”。AI-900 备考到后期你需要的不再是一份完整资料而是一份越来越薄的错题本。docx 的优势在这里彻底体现出来批注和红色字体可以同时存在而正是这种双通道的纠错机制适合刷完一轮后快速复盘。用 python-docx 提取所有红色字体的段落可以自动把错误考点聚合成一个新文档from docx import Document from docx.oxml.ns import qn doc Document(AI-900工具书_批注.docx) new_doc Document() new_doc.add_heading(个人错题本, level1) for para in doc.paragraphs: for run in para.runs: color run.font.color if color and color.rgb and str(color.rgb) FF0000: new_doc.add_paragraph(para.text) break new_doc.save(AI-900_错题本.docx)这段脚本检查每个 run 的颜色是否为纯红色FF0000。color.rgb是 RGBColor 对象转成字符串后与FF0000比较。注意break的存在是因为一个段落可能包含多个 run只要有任意一个 run 是红色就把整个段落归入错题本。如果你的红色字体用的是“深红”或者其他色号需要先查看str(color.rgb)的输出来调整对比值。绿色字体的段落表示已经掌握可以用同样的逻辑排除掉。两轮之后错题本应该只包含仍然混淆的考点此时将这些红色段落的文字提取出来配合语音朗读或者 A/B 测试法做最终冲刺。A/B 法就是把错题本按两列布局排版A 列是题干B 列是答案打印后先看 A 列说答案再翻开 B 列对答案每答对一个用黑色马克笔划掉一条。这个流程完全可以在纸质 docx 上闭环不需要任何在线工具。这份个人错题本可以根据错误类型继续细分概念混淆、场景识别错误、专属名词记混。用 Word 的“标题 2”拆成三类复习时只看错得最多的那一类即可。AI-900 是典型的概念考每题平均只有 40 到 60 秒的作答时间概念混淆和场景识别错误是最容易在考场上失分的也是这套工具书能够针对性解决的问题。本文还有配套的精品资源点击获取
上一篇/下一篇内容由系统自动关联
返回资讯列表 →