从决策出发,而不是从现有数据集出发
数据集可能是干净的,但仍然不适合用例。准备情况取决于模型将影响什么、受影响的人、错误意味着什么、条件变化的速度以及当信心较低时人们可以做什么。这些问题确定哪些事实是重要的以及需要多少证据。
用简单的操作术语定义预期的建议或行动。确定所有者、用户、主体、决策时间、替代方案和后果。然后追踪支持它所需的数据。这可以防止有吸引力的数据集创建组织无法负责任地操作的用例。
共享含义是生产级能力的依赖条件
培训和操作系统可能对不同的概念使用相同的标签。客户可以指帐户、法人、家庭或有效合同。结案可能意味着已解决、行政结束或放弃。如果含义因时期、来源或团队而异,则模型行为可能会因评估从未测试过的原因而发生变化。
关键功能和结果需要业务定义、包含和排除规则、时间背景和负责任的所有者。历史的变化应该是看得见的。目标不是记录每个字段,而是使对决策产生重大影响的含义足够稳定,以便质疑和监控。
数据血缘必须延伸到运营决策
谱系在解释值从何而来、哪些转换改变了它以及它在哪个规则或版本下进入训练、评估和生产时非常有用。技术管道图可能会显示变化,同时忽略形成数据的业务选择和修正决策。
在与风险成比例的水平上记录来源。团队应该能够调查结果、评估源更改的影响并重现相关评估。如果数据由人员或供应商丰富或标记,则该上下文及其质量控制属于谱系视图。
让质量控制反映业务后果
全局完整性和准确性分数是薄弱的准备测试。如果罕见的缺失值消除了安全或资格条件,则它可能是重大的,而频繁的缺陷可能与预期的决策无关。根据使用定义质量:影响结果的有效范围、及时性、代表性、一致性、重复性和标签可靠性。
对于每个关键缺陷,决定是否预防、检测、纠正、拒绝、升级或向相关人员明确呈现不确定性。指定所有者和操作阈值。这些控制措施应在部署后和准备期间发挥作用,因为生产源和行为会发生变化。
评估数据必须代表真实运营条件
评估集应反映能力将遇到的案例、时间段、异常和人群,包括模型应推迟的条件。与培训问题分离,但通过相关实体、结果后信息和手动更正的泄漏也是如此,而这些在决策时不会存在。
围绕业务操作定义接受度,而不是一个总体模型分数。包括重要的错误类别、人工审核能力、延迟、失败行为和暂缓判断的成本。记录数据集和规则版本,以便以后的更改可以进行有意义的比较。
生产环境需要反馈与受控变更机制
数据准备工作在启动时尚未完成。源系统发生变化,定义发生变化,操作行为发生变化,目标人群也可能发生变化。监控应以决策风险合理的节奏涵盖输入条件、数据控制、模型行为、人为覆盖、结果证据和未解决的异常。
组织还需要有权做出回应:谁进行调查、谁可以暂停自动化、后备工作如何进行、何时考虑重新培训或重新设计以及哪些证据允许恢复服务。如果没有这种操作模型,模型在其决策背景已经发生变化的情况下仍可以在技术上保持可用。