Data Science for Beginners 云端实战:用 Azure ML 低代码与 SDK 两种方式训练、部署和消费心衰预测模型
Data Science for Beginners 云端实战用 Azure ML 低代码与 SDK 两种方式训练、部署和消费心衰预测模型【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本节课程Cloud 章节围绕一个真实的数据科学项目展开使用 Kaggle 公开的心力衰竭Heart Failure临床数据集构建一个用于评估患者发生心力衰竭概率的分类模型。整个项目将完整覆盖训练 → 部署 → 消费三个环节且提供两条截然不同的实现路径一条是纯图形界面操作的Low code/No code低代码/无代码路线另一条是使用Azure Machine Learning SDK编写 Python 代码的编程路线。读完本文你将掌握云计算的核心理念与服务体系理解为何云是大数据场景下数据科学的游戏规则改变者并能在 Azure 上独立完成从创建工作区、配置计算资源、上传数据集、AutoML 训练到将模型发布为 Web 服务并用 REST 端点实时预测的完整链路。本节课程最初由 Maud Levy 与 Tiffany Souterre 编写属于 Data-Science-For-Beginners 课程体系中 5-Data-Science-In-Cloud 章节。本译文版位于 translations/es/5-Data-Science-In-Cloud/README.md英文原版见 5-Data-Science-In-Cloud/README.md。章节总览一个项目两种实现方式当处理大规模数据时云可以成为数据科学的游戏规则改变者。本章节接下来的三节课将依次回答三个问题云是什么、为什么对数据科学很有用以及如何用云来完成一个真实项目。章节采用同一个心衰预测项目作为贯穿三节课的主线但提供两条不同的技术路线如下图所示本主题共包含三节课分别对应 5-Data-Science-In-Cloud 目录下的三个子目录为什么使用云做数据科学 —— 讲解云计算的基础概念、服务模型与典型应用场景云数据科学低代码/无代码方式 —— 完全通过 Azure Machine Learning Studio 图形界面完成训练、部署与消费云数据科学Azure ML SDK 方式 —— 使用 Python SDK 以代码方式复现同样的完整流程。项目与数据来源心衰预测项目使用的数据来自 Kaggle 上公开的Heart Failure Clinical Records数据集由 Larxel 发布采用 Attribution 4.0 International (CC BY 4.0) 许可。这是一个包含13 列12 个特征 1 个目标变量、299 行的表格型数据集。心血管疾病CVDs是全球第一大死因约占全球死亡总数的 31%因此若能利用烟草使用、不健康饮食、肥胖、缺乏运动、酗酒等环境与行为风险因素估算 CVD 发生概率对高危人群的预防将非常有价值。完整字段说明如下表序号变量名类型描述示例1age数值患者年龄252anaemia布尔红细胞或血红蛋白减少0 或 13creatinine_phosphokinase数值血液中 CPK 酶水平5424diabetes布尔患者是否患有糖尿病0 或 15ejection_fraction数值每次收缩时离开心脏的血液百分比456high_blood_pressure布尔患者是否有高血压0 或 17platelets数值血液中的血小板数1490008serum_creatinine数值血液中血清肌酐水平0.59serum_sodium数值血液中血清钠水平13710sex布尔女或男0 或 111smoking布尔患者是否吸烟0 或 112time数值随访期天421DEATH_EVENT [目标]布尔随访期内患者是否死亡0 或 1两条路线的取舍对比低代码/无代码路线因为只需要与图形界面GUI交互、无需任何代码基础更适合快速验证项目可行性和构建概念验证POC。但随着项目成长、需要面向生产环境交付时通过 GUI 手工创建资源就不再可行——必须用代码将资源创建、模型部署等一切步骤自动化这正是掌握 Azure ML SDK 的价值所在。两种方式的差异总结如下对比维度低代码/无代码Azure ML SDK代码能力要求不需要需要开发耗时快速且简单取决于代码熟练度生产就绪程度否是第一课为什么选择云做数据科学什么是云云Cloud或称云计算Cloud Computing是指通过互联网按需交付的、托管在基础设施之上的一系列计算服务涵盖存储、数据库、网络、软件、分析以及智能服务等。按部署形态通常区分为三类公有云Public cloud由第三方云服务商拥有和运营通过互联网向公众交付计算资源私有云Private cloud计算资源仅供单一企业或组织独占使用服务和基础设施维护在私有网络上混合云Hybrid cloud公有云与私有云相结合的系统用户保留本地数据中心同时允许数据和应用运行在一个或多个公有云上。绝大多数云服务可以归入三大服务模型基础设施即服务IaaS用户租用 IT 基础设施如服务器、虚拟机VM、存储、网络、操作系统等平台即服务PaaS用户租用开发、测试、交付和管理软件应用的完整环境无需操心底层服务器、存储、网络和数据库的搭建与维护软件即服务SaaS用户按需通常按订阅通过互联网获取软件应用访问权无需关心软件托管、底层基础设施以及软件升级、安全补丁等维护工作。主要的云服务商包括 Amazon Web Services、Google Cloud Platform 与 Microsoft Azure。数据科学家选择云的七大理由开发者与 IT 从业者选择云的原因包括创新可直接将云服务商打造的创新服务集成进应用为应用赋能灵活性只需为所需服务付费按需使用pay as you go并随需求演进调整服务预算无需前期投入购买硬件与软件、搭建并运营本地数据中心只用多少付多少可伸缩性资源可按项目需求伸缩应用可根据外部因素随时增减算力、存储与带宽生产力可以把精力聚焦在业务本身将数据中心运维等任务交由他人管理可靠性云计算提供多种持续备份数据的方式可制定灾难恢复计划即使危机时期也能维持业务与服务运转安全可受益于云服务商提供的策略、技术与控制措施强化项目安全。云如何解决数据科学家面临的挑战针对数据科学家和数据处理开发者的具体痛点云给出了对应解法存储海量数据无需购买、管理与防护大型服务器可直接将数据存放在云端如 Azure Cosmos DB、Azure SQL Database、Azure Data Lake Storage执行数据集成集成是数据科学从数据采集走向采取行动的关键环节借助云端数据集成服务如 Data Factory可从多源采集、转换并整合数据到统一的数据仓库处理数据处理海量数据需要巨大算力并非人人都有足够强大的机器因此很多人选择直接借助云的庞大算力来运行和部署解决方案使用数据分析服务如 Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks帮助把数据转化为可执行的洞察使用机器学习与数据智能服务不必从零开始可直接使用云服务商提供的机器学习算法如 Azure ML也可使用语音转文本、文本转语音、计算机视觉等认知服务。云上数据科学的典型案例案例一社交媒体实时情感分析。假设你运营一个新闻媒体网站想利用实时数据理解读者感兴趣的内容可以构建一个对 Twitter 数据做实时情感分析的程序。关键指标是特定话题标签的推文量以及基于分析工具得到的情感倾向。项目步骤为创建用于流式输入的事件中心Event Hub以收集 Twitter 数据 → 配置并启动调用 Twitter Streaming API 的客户端应用 → 创建 Stream Analytics 作业 → 指定作业输入与查询 → 创建输出接收器并指定作业输出 → 启动作业。案例二科研论文分析。本课程作者之一 Dmitry Soshnikov 创建了一个分析 COVID 论文的工具展示了如何构建从论文中提取知识、获得洞察、帮助研究者高效检索海量论文集的应用。其流程为用 Text Analytics for Health 提取并预处理信息 → 用 Azure ML 并行化处理 → 用 Cosmos DB 存储与查询信息 → 用 Power BI 创建交互式仪表盘进行数据探索与可视化。第二课低代码/无代码方式训练心衰预测模型Azure Machine Learning 是什么Azure 云平台提供 200 多个产品与云服务。数据科学家在探索和预处理数据、尝试各种模型训练算法上耗费大量精力这些任务耗时且常使昂贵的计算硬件利用率低下。Azure ML正是在 Azure 上构建和运行机器学习解决方案的云端平台帮助数据科学家准备数据、训练模型、发布预测服务并监控其使用情况核心价值在于通过自动化训练中大量耗时任务提升效率并借助可按需扩展的云端算力处理大数据量、仅在真正使用时才产生成本。Azure ML 为机器学习工作流提供的工具包括Azure Machine Learning Studio面向低代码/无代码训练、部署、自动化、跟踪与资产管理的一站式 Web 门户并与 Azure ML SDK 无缝集成Jupyter Notebooks快速原型化和测试 ML 模型Azure Machine Learning Designer通过拖拽模块构建实验并在低代码环境中部署管道自动机器学习 UIAutoML自动化模型开发的迭代任务以高规模、高效率和高生产力构建 ML 模型同时保持模型质量Data Labelling数据标注自动标注数据的辅助 ML 工具Visual Studio Code 的机器学习扩展构建和管理 ML 项目的全功能开发环境机器学习 CLI从命令行管理 Azure ML 资源的命令工具开源框架集成支持 PyTorch、TensorFlow、Scikit-learn 等覆盖训练、部署与端到端流程管理MLflow管理机器学习实验生命周期的开源库其中 MLflow Tracking 组件负责记录和跟踪训练运行的指标与模型工件与实验环境无关。2.1 创建 Azure ML 工作区训练模型前需要先创建Azure ML 工作区workspace——它是 Azure 机器学习的顶级资源提供集中管理所有工件的场所并保存所有训练运行的历史记录包括日志、指标、输出和脚本快照用于判断哪次训练产生了最佳模型。创建前请注意浏览器要求推荐使用与操作系统兼容的最新版浏览器支持 Microsoft Edge新版非 legacy 版、Safari最新版仅 Mac、Chrome最新版、Firefox最新版。注意只要工作区存在于订阅中就会因数据存储产生少量费用因此建议不再使用时删除 Azure ML 工作区。创建步骤使用与 Azure 订阅关联的 Microsoft 凭据登录 Azure 门户选择创建资源Create a resource搜索 Machine Learning选择 Machine Learning 磁贴并点击创建按钮按以下设置填写创建过程可能需要几分钟配置项取值说明Subscription你的 Azure 订阅Resource group创建或选择资源组Workspace name为工作区输入唯一名称Region选择离你最近的地理区域Storage account记录将为工作区创建的默认新存储账户Key vault记录默认新建的密钥保管库Application insights记录默认新建的应用洞察资源Container registry无首次将模型部署到容器时自动创建点击 create review 后点击创建按钮等待工作区创建完成在工作区概述页面启动 Azure Machine Learning studio或在浏览器新标签页打开 https://ml.azure.com用 Microsoft 账户登录如提示选择 Azure 目录、订阅和工作区在 Studio 中点击左上角 ☰ 图标即可切换查看界面中的各个页面管理工作区内的各类资源。相比 Azure 门户对数据科学家和 ML 运维工程师而言Studio 提供了更聚焦的工作区资源管理界面。2.2 计算资源Compute Resources计算资源是运行模型训练与数据探索流程的云端资源共四种计算实例Compute Instances数据科学家处理数据和模型的开发工作站本质是创建一台虚拟机VM并启动笔记本实例可从笔记本中调用计算集群来训练模型计算集群Compute Clusters按需处理实验代码的可伸缩 VM 集群训练模型时需要用到可采用专用 GPU 或 CPU 资源推理集群Inference Clusters使用已训练模型的预测服务的部署目标附加计算Attached Compute链接到现有 Azure 计算资源如虚拟机或 Azure Databricks 集群。选择计算资源时的关键决策CPU 还是 GPUCPU 是执行计算机程序指令的电子电路擅长快速处理广泛任务但并发能力有限GPU 是能以极高速度执行图形相关代码的专用电路专为并行计算设计在深度学习任务上明显更优。两者取舍CPU 更便宜、并发级别低、训练深度学习模型更慢GPU 更贵、并发级别高、是深度学习的理想选择。集群大小Cluster Size更大的集群更贵但响应更好。时间充足而预算有限时应从小集群起步反之若资金充足而时间紧张则用较大集群。VM 大小VM Size可根据时间与预算约束调整 RAM、磁盘、核数与时钟频率参数越大成本越高但性能越好。专用还是低优先级实例低优先级实例是可中断的——Azure 可能把资源收回分配给其他任务从而中断你的作业专用不可中断实例则永远不会未经许可被终止。这是时间与金钱的又一权衡可中断实例比专用实例更便宜。创建计算集群在 Azure ML 工作区 中进入 Compute 菜单可看到上述四类计算资源。本项目训练模型需要一个计算集群在 Studio 点击 Compute 菜单 → Compute cluster 选项卡 → 点击 New 创建选择选项专用 vs 低优先级、CPU 或 GPU、VM 大小和核数本项目可保留默认设置点击 Next为集群命名选择选项最小/最大节点数、缩容前空闲秒数、SSH 访问。注意最小节点数为 0 时集群空闲即可省钱最大节点数越高训练越短推荐最大节点数为3点击 Create此步骤可能需要几分钟。2.3 加载数据集在 Azure ML 工作区点击左侧菜单 Datasets → Create dataset选择 From local files选取之前下载的 Kaggle 数据集给数据集命名、设置类型和描述点击 Next 上传文件在 Schema 步骤中为以下特征将数据类型改为Booleananaemia、diabetes、high blood pressure、sex、smoking、DEATH_EVENT然后点击 Next 和 Create。数据集就位、计算集群创建完成后即可开始模型训练。2.4 用 AutoML 进行低代码训练传统的模型开发需要大量资源、领域知识和时间才能产出并比较几十个模型。自动机器学习AutoML自动化了模型开发中耗时且迭代的任务让数据科学家、分析师和开发者以高规模、高效率、高生产力构建 ML 模型同时保持模型质量大幅缩短获得生产级模型的时间。操作步骤在工作区点击左侧 Automated ML选择刚上传的数据集点击 Next输入新的实验名experiment name、目标列DEATH_EVENT以及刚创建的计算集群点击 Next选择Classification分类点击 Finish。此步骤根据计算集群大小可能需要30 分钟到 1 小时运行完成后点击 Automated ML 选项卡点击你的运行在 Best model summary 卡片中点击算法即可查看 AutoML 生成的最佳模型的详细描述也可以在 Models 选项卡中探索其他模型并在 Explanations预览按钮中查看模型解释。3.1 部署模型AutoML 界面支持在几步内将最佳模型部署为 Web 服务。对本项目而言部署意味着医疗应用可以消费该模型对患者心脏病发作风险进行实时预测。在最佳模型描述中点击Deploy按钮输入名称、描述、计算类型选择Azure Container Instance启用身份验证enable authentication点击 Deploy。此步骤约需20 分钟部署流程包含注册模型、生成资源并为 Web 服务配置等若干环节在 Deploy status 下会显示状态消息可定期点击 Refresh 查看进度状态变为Healthy即表示部署完成并运行中部署完成后点击 Endpoint 选项卡并点击刚部署的端点可查看该端点的全部详细信息。3.2 消费端点点击Consume选项卡可看到 REST 端点以及消费选项中的 Python 脚本该脚本可直接在本地机器上运行并消费你的端点。脚本中的两行关键代码url http://98e3715f-xxxx-xxxx-xxxx-9ec22d57b796.centralus.azurecontainer.io/score api_key # Replace this with the API key for the web serviceurl变量即 Consume 页中的 REST 端点api_key变量是 Consume 页中的主键仅在启用身份验证的情况下需要。脚本正是通过这两项信息消费端点。运行脚本会得到输出b{\\result\\: [true]}这表示对给定数据的心衰预测结果为true会发生心衰。这是因为脚本自动生成的样例数据中所有字段默认都是 0 和 false。把输入样本替换为下面的数据data { data: [ { age: 0, anaemia: false, creatinine_phosphokinase: 0, diabetes: false, ejection_fraction: 0, high_blood_pressure: false, platelets: 0, serum_creatinine: 0, serum_sodium: 0, sex: false, smoking: false, time: 0, }, { age: 60, anaemia: false, creatinine_phosphokinase: 500, diabetes: false, ejection_fraction: 38, high_blood_pressure: false, platelets: 260000, serum_creatinine: 1.40, serum_sodium: 137, sex: false, smoking: false, time: 130, }, ], }脚本应返回b{\\result\\: [true, false]}第二组样本60 岁、ejection_fraction 38、time 130 天等更接近真实患者的临床指标得到false的预测结果说明该患者不太可能发生心力衰竭。至此你就通过低代码方式完成了模型的云端训练、部署与消费。注意项目完成后不要忘记删除所有资源。第三课Azure ML SDK 方式训练心衰预测模型Azure ML SDK 是什么数据科学家和 AI 开发者使用Azure Machine Learning SDK构建和运行机器学习工作流可在任意 Python 环境中与服务交互包括 Jupyter Notebooks、Visual Studio Code 或你喜欢的 Python IDE。SDK 的关键能力包括探索、准备并管理机器学习实验中数据集的完整生命周期管理用于监控、记录和组织机器学习实验的云资源在本地或使用云资源包括 GPU 加速训练模型使用自动机器学习接收配置参数和训练数据自动迭代算法与超参数设置为预测找到最佳模型部署 Web 服务把训练好的模型转换为可被任意应用消费的 RESTful 服务。上一课我们用低代码方式完成了心衰预测全流程本课将用 Azure ML SDK 复现完全相同的过程。仓库中提供了可上传到 Azure ML Studio 的现成笔记本19-Azure/notebook.ipynb英文版翻译版位于 translations/es/5-Data-Science-In-Cloud/19-Azure/notebook.ipynb其中按顺序包含了实验创建、计算集群、AutoML 配置与运行、最佳模型注册、部署与端点消费的全部单元格也可以参考 solution 目录下的解答版。2.1 创建工作区与计算实例为简单起见SDK 路线在 Jupyter Notebook 中展开前提是你已有工作区和计算实例。若尚未创建工作区请参照上一课创建 Azure ML 工作区一节完成。随后在工作区中进入 Compute 菜单创建计算实例点击 New → 为计算实例命名 → 选择 CPU 或 GPU、VM 大小和核数 → 点击 Create。2.4 创建 Notebook注意下一步可以新建笔记本也可以直接把仓库中的 notebook.ipynb 上传到 Azure ML Studio点击 Notebook 菜单上传即可。Notebook 是数据科学流程中非常重要的一环可用于开展探索性数据分析EDA、调用计算集群训练模型、调用推理集群部署端点。创建步骤回到工作区点击 Compute instances在列表中看到刚创建的计算实例在 Applications 区域点击 Jupyter 选项勾选 Yes, I understand 并点击 Continue浏览器新标签页会打开 Jupyter 实例点击 New 按钮创建笔记本。2.5.1 初始化工作区、实验、计算集群与数据集从配置文件加载工作区对象from azureml.core import Workspace ws Workspace.from_config()该代码返回类型为Workspace的对象代表你的工作区配置文件 config.json 需放在当前目录。随后创建实验from azureml.core import Experiment experiment_name aml-experiment experiment Experiment(ws, experiment_name)按实验名从工作区获取或创建实验。实验名必须为 3-36 个字符以字母或数字开头只能包含字母、数字、下划线和短横线若工作区中不存在同名实验则新建一个。接下来为训练创建计算集群此步骤可能需要几分钟from azureml.core.compute import AmlCompute aml_name heart-f-cluster try: aml_compute AmlCompute(ws, aml_name) print(Found existing AML compute context.) except: print(Creating new AML compute context.) aml_config AmlCompute.provisioning_configuration(vm_size Standard_D2_v2, min_nodes1, max_nodes3) aml_compute AmlCompute.create(ws, name aml_name, provisioning_configuration aml_config) aml_compute.wait_for_completion(show_output True) cts ws.compute_targets compute_target cts[aml_name]代码首先尝试获取名为heart-f-cluster的现有计算集群不存在则用AmlCompute.provisioning_configuration配置VM 规格Standard_D2_v2、最小 1 节点、最大 3 节点并创建随后wait_for_completion阻塞等待创建完成最后从ws.compute_targets取出计算目标。按数据集名从工作区加载数据dataset ws.datasets[heart-failure-records] df dataset.to_pandas_dataframe() df.describe()注意数据集键key必须与上传时设定的数据集名称一致。2.5.2 AutoML 配置与训练使用AutoMLConfig类配置 AutoML。本项目使用的参数及其含义experiment_timeout_minutes实验允许运行的最大时间分钟超过后自动停止并自动提供结果max_concurrent_iterations实验允许的最大并发训练迭代数primary_metric用于确定实验状态的主要指标compute_target运行自动机器学习实验的计算目标task要运行的任务类型可选 classification、regression 或 forecastingtraining_data实验使用的训练数据应同时包含训练特征和标签列label_column_name标签列的名称pathAzure ML 项目文件夹的完整路径enable_early_stopping短期内分数无改善时是否启用提前终止featurization是否自动执行特征化步骤或使用自定义特征化debug_log写入调试信息的日志文件。from azureml.train.automl import AutoMLConfig project_folder ./aml-project automl_settings { experiment_timeout_minutes: 20, max_concurrent_iterations: 3, primary_metric : AUC_weighted } automl_config AutoMLConfig(compute_targetcompute_target, task classification, training_datadataset, label_column_nameDEATH_EVENT, path project_folder, enable_early_stopping True, featurization auto, debug_log automl_errors.log, **automl_settings )配置就绪后提交训练根据集群大小最多可能运行 1 小时remote_run experiment.submit(automl_config)可用 RunDetails 小部件展示不同实验from azureml.widgets import RunDetails RunDetails(remote_run).show()3.1 保存最佳模型remote_run是AutoMLRun类型的对象其get_output()方法返回最佳运行及对应的已拟合模型best_run, fitted_model remote_run.get_output()打印fitted_model可查看最佳模型的参数用get_properties()可查看最佳模型的属性best_run.get_properties()然后用register_model注册模型。从最佳运行中下载 AutoML 自动生成的评分脚本outputs/scoring_file_v_1_0_0.py作为部署入口脚本model_name best_run.properties[model_name] script_file_name inference/score.py best_run.download_file(outputs/scoring_file_v_1_0_0.py, inference/score.py) description aml heart failure project sdk model best_run.register_model(model_name model_name, model_path ./outputs/, description description, tags None)3.2 部署模型保存最佳模型后用InferenceConfig类配置部署它表示部署时使用的自定义环境配置。AciWebservice类表示部署在 Azure 容器实例上的 Web 服务端点由模型、脚本及相关文件创建最终形成带 REST API 的负载均衡 HTTP 端点可向其发送数据并接收模型预测结果。使用Model.deploy方法执行部署from azureml.core.model import InferenceConfig, Model from azureml.core.webservice import AciWebservice inference_config InferenceConfig(entry_scriptscript_file_name, environmentbest_run.get_environment()) aciconfig AciWebservice.deploy_configuration(cpu_cores 1, memory_gb 1, tags {type: automl-heart-failure-prediction}, description Sample service for AutoML Heart Failure Prediction) aci_service_name automl-hf-sdk aci_service Model.deploy(ws, aci_service_name, [model], inference_config, aciconfig) aci_service.wait_for_deployment(True) print(aci_service.state)此步骤需要几分钟。其中AciWebservice.deploy_configuration指定了 1 核 CPU、1 GB 内存以及标签和描述wait_for_deployment(True)会阻塞直到部署完成aci_service.state打印部署状态。3.3 消费端点构造样本输入并编码后发送给端点data { data: [ { age: 60, anaemia: false, creatinine_phosphokinase: 500, diabetes: false, ejection_fraction: 38, high_blood_pressure: false, platelets: 260000, serum_creatinine: 1.40, serum_sodium: 137, sex: false, smoking: false, time: 130, }, ], } test_sample str.encode(json.dumps(data)) response aci_service.run(input_datatest_sample) response输出为{result: [false]}表示该患者不太可能发生心力衰竭。至此你已用 Azure ML SDK 完整走通了云端模型训练、部署与消费流程。注意项目完成后不要忘记删除所有资源。课后挑战与延伸挑战一低代码路线仔细观察 AutoML 为排名靠前的模型生成的模型解释与详情尝试理解为什么最佳模型优于其他模型AutoML 比较了哪些算法它们之间的差异是什么为什么在本案例中最佳模型表现更好挑战二SDK 路线SDK 还能做很多事。翻阅 Azure ML SDK 文档找到允许创建管道的Pipeline类——管道是可按工作流执行的一组步骤。在 SDK 文档搜索栏中输入 Pipeline 等关键词即可在结果中找到azureml.pipeline.core.Pipeline类。此外章节还为每节课配置了对应的实践作业第一课作业云服务商市场调研 —— 研究三家或以上云服务商能为数据科学家提供什么对比其数据科学产品是否可相提并论并撰写一篇一页纸的分析论文第二课作业低代码数据科学项目 —— 在 Kaggle 或 Azure Open Datasets 上另找数据集用 AutoML 完成训练、部署与消费进阶要求包括上传数据时正确设置特征类型、必要时清洗数据、查看模型解释第三课作业Azure ML SDK 数据科学项目 —— 用 Azure ML SDK 对另一个数据集完成同样的训练、部署与消费流程进阶要求是查阅 SDK 文档、熟悉 AutoML 配置可用参数并查看模型解释。小结通过本章节的三个主题你可以掌握一条完整的云上数据科学技能链先理解云计算的本质、服务模型与数据科学场景下的价值再以心衰预测项目为实战载体体验低代码/无代码与 Azure ML SDK 两条实现路径。前者让你无需编写代码即可快速验证 AutoML 的分类效果并上线 REST 端点后者则让你以完全可编程、可自动化的方式重现同一流程为生产级 ML 工程的资源编排、管道构建与持续部署奠定基础。无论选择哪条路径都别忘了在实验结束后清理工作区与相关资源避免持续产生存储费用。课程相关的测验每课课前/课后测验与作业可通过 quiz-app 目录中的测验应用获得更多章节内容请回到课程主页 README.md 继续学习。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →