MLS-C01 题库 · 最新 50 题免费预览(第 2/5 页)
MLS-C01(AWS Certified Machine Learning Specialty (MLS-C01))最新题库第 11–20 题,共 5 页 50 题,含答案与中英解析,无需登录。点此进入在线题库练习全部 380 题。
第 11 题 · 题号 341 · 单选
一家公司正在为来自不同部门的数据科学家和工程师建立一种机制,以访问 Amazon SageMaker Studio 域。每个部门都有一个唯一的 SageMaker Studio 域。该公司希望构建一个中央代理应用程序,数据科学家和工程师可以使用他们的公司凭据登录该应用程序。代理应用程序将使用公司现有的身份提供商 (IdP) 对用户进行身份验证。然后,应用程序会将用户路由到相应的 SageMaker Studio 域。该公司计划在 Amazon DynamoDB 中维护一个表,其中包含每个部门的 SageMaker 域。公司应该如何满足这些要求?
- A. 使用 SageMaker CreatePresignedDomainUrl API 根据 DynamoDB 表为每个域生成预签名 URL。将预签名的 URL 传递给代理应用程序。
- B. 使用 SageMaker CreateHumanTaskUi API 生成 UI URL。将 URL 传递给代理应用程序。
- C. 使用 Amazon SageMaker ListHumanTaskUis API 列出所有 UI URL。将相应的 URL 传递给 DynamoDB 表,以便代理应用程序可以使用该 URL。
- D. 使用 SageMaker CreatePresignedNotebooklnstanceUrl API 生成预签名 URL。将预签名的 URL 传递给代理应用程序。
答案: A
解析: 选择了选项A,因为公司希望建立一个可以通过使用公司现有身份提供者(IdP)对用户进行身份验证,并将其路由到适当的SageMaker Studio域的中央代理应用程序。 使用SageMaker CreatePresignedDomainUrl API根据DynamoDB表为每个域生成一个预签名URL,并将预签名URL传递给代理应用程序符合这些要求。
第 12 题 · 题号 342 · 单选
一家在线零售商的机器学习 (ML) 开发人员最近将销售数据集上传到 Amazon SageMaker Studio。ML 开发人员希望获取数据集每个特征的重要性分数。ML 开发人员将使用重要性分数对数据集进行特征工程。哪种解决方案可以通过最少的开发工作来满足这一要求?
- A. 使用SageMaker Data Wrangler执行基尼重要性得分分析。
- B. 使用 SageMaker 笔记本实例执行主成分分析 (PCA)。
- C. 使用 SageMaker 笔记本实例执行奇异值分解分析。
- D. 使用多重共线性特征执行套索特征选择以执行重要性分数分析。
答案: A
解析: 选择了选项A,因为使用SageMaker Data Wrangler执行基尼重要性分数分析将需要比其他提供的选项更少的开发工作。
第 13 题 · 题号 343 · 多选
一位数据科学家正在尝试提高神经网络分类模型的准确性。数据科学家希望在 Amazon SageMaker 中运行大型超参数优化作业。但是,以前在同一型号上进行的小型调整作业通常会运行数周。ML 专家希望减少运行优化作业所需的计算时间。哪些操作将减少超参数优化作业的计算时间?(选择两个。
- A. 使用超频段调整策略。
- B. 增加超参数的数量。
- C. 为 MaxNumberOfTrainingJobs 参数设置较低的值。
- D. 使用网格搜索优化策略。
- E. 为 MaxParallelTrainingJobs 参数设置较低的值。
答案: A, C
第 14 题 · 题号 344 · 单选
机器学习工程师正在构建鸟类分类模型。工程师将数据集随机分为训练数据集和验证数据集。在训练阶段,模型实现了非常高的精度。然而,在验证数据集的验证过程中,该模型的泛化效果不佳。工程师意识到原始数据集不平衡。工程师应该怎么做才能提高模型的验证精度?
- A. 对原始数据集进行分层抽样。
- B. 获取有关原始数据集中多数类的其他数据。
- C. 使用较小的随机抽样版本的训练数据集。
- D. 对原始数据集进行系统采样。
答案: A
解析: 选择了选项A,因为在原始数据集上执行分层抽样将有助于解决数据不平衡的问题。这种技术确保在训练和验证数据集中,每个类别在原始数据集中的存在比例都得到了体现,这可以帮助提高模型的泛化能力。
第 15 题 · 题号 345 · 单选
数据科学家正在对包含产品供应商相关信息的数据集进行探索性数据分析 (EDA)。该数据集将每个产品供应商所在的国家/地区记录为两个字母的文本代码。例如,新西兰的代码是 “NZ”。数据科学家需要转换国家/地区代码以进行模型训练。数据科学家必须选择将导致维度增加最小的解决方案。该解决方案不得导致任何信息丢失。哪种解决方案将满足这些要求?
- A. 添加包含完整国家/地区名称的新数据列。
- B. 使用相似性编码将国家/地区代码编码为数字变量。
- C. 将国家/地区代码映射到大洲名称。
- D. 使用 one-hot encoding 将国家/地区代码编码为数字变量。
答案: B
第 16 题 · 题号 346 · 单选
一家媒体公司正在构建一个计算机视觉模型来分析社交媒体上的图像。该模型由该公司使用存储在 Amazon S3 中的图像训练的 CNN 组成。该公司在文件模式下使用具有单个 Amazon EC2 按需实例的 Amazon SageMaker 训练作业。每天,该公司都会使用公司在过去 24 小时内收集的大约 10000 张图像来更新模型。该公司仅使用一个 epoch 配置 training。该公司希望加快培训速度并降低成本,而无需更改任何代码。哪种解决方案将满足这些要求?
- A. 将 SageMaker 训练作业配置为使用 Pipe 模式,而不是文件模式。从管道中提取数据。
- B. 将 SageMaker 训练作业配置为使用 FastFile 模式,而不是文件模式,没有其他更改。
- C. 将 SageMaker 训练作业配置为使用 Spot 实例,而不是按需实例。不进行其他更改,
- D. 将 SageMaker 训练作业配置为使用 Spot 实例,而不是按需实例,实施模型检查点。
答案: B
第 17 题 · 题号 347 · 单选
公司需要开发一个使用机器学习 (ML) 模型进行风险分析的模型。在 ML 工程师选择特征之前,ML 工程师需要评估训练数据集的每个特征对目标变量预测的贡献。ML 工程师应该如何预测每个特征的贡献?
- A. 使用 Amazon SageMaker Data Wrangler 多重共线性测量特征和主成分分析 (PCA) 算法来计算数据集在特征空间中沿多个方向的方差。
- B. 使用 Amazon SageMaker Data Wrangler 快速模型可视化来查找介于 0.5 和 1 之间的特征重要性分数。
- C. 使用 Amazon SageMaker Data Wrangler 偏差报告来识别与特征工程相关的数据中的潜在偏差。
- D. 使用 Amazon SageMaker Data Wrangler 数据流创建和修改数据准备管道。手动添加功能分数。
答案: B
第 18 题 · 题号 348 · 单选
一家旅游公司使用机器学习 (ML) 模型向客户提供建议。该公司使用 Amazon SageMaker 环境,并将超参数优化完成标准设置为 MaxNumberOfTrainingJobs。ML 专家想要更改超参数优化完成标准。在内部算法确定优化作业不太可能比最佳训练作业的目标指标提高 1% 以上后,ML 专家希望立即停止优化。哪些完成标准将满足此要求?
- A. MaxRuntimeInSeconds 秒数
- B. TargetObjectiveMetricValue
- C. CompleteOnConvergence
- D. MaxNumberOfTrainingJobsNotImproving
答案: C
解析: 在提供的背景下,该旅游公司利用了Amazon SageMaker环境以及设定的超参数调整完成条件以确定训练作业的最大数量。在这种情况下,机器学习专家希望在内部算法确定调整任务不太可能在目标指标上超过最佳训练任务1%的改进后,立即停止调整。这种需求与 'CompleteOnConvergence' 完成标准相匹配,因为它会在模型收敛或达到预设的性能水平时自动停止训练,无需人工干预。
第 19 题 · 题号 349 · 单选
一家银行公司向世界各地的客户提供金融产品。机器学习 (ML) 专家从内部客户那里收集交易数据。ML 专家将数据集拆分为训练、测试和验证数据集。ML 专家使用 Amazon SageMaker Clarify 分析了训练数据集。分析发现,与其他年龄组相比,训练数据集包含 40 至 55 岁年龄组的客户示例较少。ML 专家在训练数据集中观察到了哪种类型的预训练偏差?
- A. 标签比例差异 (DPL)
- B. 类不平衡 (Class imbalance, CI)
- C. 条件性人口差异 (CDD)
- D. 科尔莫戈罗夫-斯米尔诺夫 (堪萨斯州)
答案: B
解析: 在训练数据集中,机器学习(ML)专家观察到的预训练偏见类型是类别不均衡(CI)。类别不均衡意味着训练集中某些类别的样本数量明显少于其他类别,这可能导致模型在某些类别上的性能不佳。在给定的情境中,40至55岁年龄组的客户样本较少,与其他年龄组相比,这意味着存在类别不均衡的偏见。
第 20 题 · 题号 350 · 单选
一家制造公司将生产量数据存储在 PostgreSQL 数据库中。该公司需要一个端到端解决方案,使业务分析师能够准备要处理的数据,并根据上一年的产量预测未来的产量。该解决方案不得要求公司具备编码知识。哪种解决方案能够以最少的工作量满足这些要求?
- A. 使用 AWS Database Migration Service (AWS DMS) 将数据从 PostgreSQL 数据库传输到 Amazon S3 存储桶。创建 Amazon EMR 除尘器以读取 S3 存储桶并执行数据准备。使用 Amazon SageMaker Studio 进行预测建模。
- B. 使用 AWS Glue DataBrew 读取 PostgreSQL 数据库中的数据并执行数据准备。使用 Amazon SageMaker Canvas 进行预测建模。
- C. 使用 AWS Database Migration Service (AWS DMS) 将数据从 PostgreSQL 数据库传输到 Amazon S3 存储桶。使用 AWS Glue 读取 S3 存储桶中的数据并执行数据准备。使用 Amazon SageMaker Canvas 进行预测建模。
- D. 使用 AWS Glue DataBrew 读取 PostgreSQL 数据库中的数据并执行数据准备。使用 Amazon SageMaker Studio 进行预测建模。
答案: B