ETSI 发布了 TR 104 180,这是一份技术报告,定义了 18 个衡量数据质量的指标,并为公司提供了一种在使用数据之前检查其数据是否足以支持 AI 的方法。该报告定义了每个指标并包含计算该指标所需的公式。

指标分为四组。第一个涉及数据是否完整、准确、一致且无重复的基础知识。第二个问题询问数据是否可以使用,这意味着数据在需要时可用,并且有足够的记录,可以追溯到其来源并保持最新状态。
公平是第三组,就是信息是否平等对待不同人群。隐私通过检查数据主体是否可以被识别以及敏感细节是否受到保护来完成列表。
“重要的是,数据的质量是可测量的,特别是对于需要确定数据是否满足主要目标的组织来说,例如,就人工智能而言,它是可靠的。” 迭戈·洛佩兹ETSI DATA技术委员会主席表示。
“ETSI 的标准化指标为评估数据质量提供了一种通用语言,并提供了数据集是否适合用途的定量证据。随着人工智能和数据驱动技术的不断发展,这为更一致和可重复的数据质量评估方法提供了重要基础,”洛佩兹说。
为了测试这些指标,TR 104 180 背后的研究人员将它们应用于两个公共数据集。飞机的一个引擎不断读取传感器的数据。另一个是美国人口普查数据集,该数据集长期以来一直用于机器学习研究,旨在预测某人的年收入是否会超过 50,000 美元。
发动机信息保存完好。随着时间的推移,它是完整、准确和稳定的。人口普查数据引发了更多担忧。
性别数字差距
研究人员研究了人口普查数据中男性和女性之间的差异。数据集中大约 31% 的男性被标记为高收入者,而女性的这一比例约为 11%。该间隔大约是 TR 104 180 视为偏见警告信号的三倍。
一个数据集中的两个隐私问题
人口普查数据在隐私方面也有两个方面的失败。首先,仅查看四个细节:年龄、种族、性别和国家/地区,就足以隔离数据集中的特定人员。有些人可以被独立识别,报告将其视为严重风险。
其次,当研究人员检查敏感字段是否受到保护时,他们将个人信息以纯文本形式保存,没有屏蔽或加密。
TR 104 180 将这两个发现视为数据质量故障。匿名性和保密性与准确性和完整性出现在同一列表中,并使用相同类型的公式进行评分。
TR 104 180 由世宗大学、EGM、TTA、大田大学和 CNIT 组成的工作组共同开发。该团队还创建了一个开源工具,可以根据 18 项指标对任何数据集进行评分。