数据沿袭
什么是数据沿袭?
数据沿袭揭示了数据的生命周期,旨在显示从开始到结束的完整数据流。数据沿袭是在数据从数据源流向消费时理解、记录和可视化数据的过程。这包括数据在此过程中经历的所有转换——数据如何转换、发生了什么变化以及原因。
数据沿袭过程
数据沿袭允许公司:
- 跟踪数据处理中的错误
- 以较低的风险实施流程变更
- 充满信心地执行系统迁移
- 将数据发现与元数据的全面视图相结合,创建数据映射框架
数据沿袭可帮助用户确保其数据来自可信来源、已正确转换并加载到指定位置。当战略决策依赖于准确信息时,数据沿袭发挥着重要作用。如果没有正确跟踪数据过程,验证数据几乎不可能,或者至少非常昂贵且耗时。
数据沿袭侧重于验证数据的准确性和一致性,允许用户从源到目的地进行上游和下游搜索,以发现异常并纠正它们。
为什么数据沿袭很重要?
仅了解特定数据集的来源并不总是足以了解其重要性、执行错误解决、了解流程更改以及执行系统迁移和更新。
了解谁进行了更改、如何更新以及使用的流程可以提高数据质量。它允许数据保管人确保数据的完整性和机密性在其整个生命周期中受到保护。
数据沿袭可以在以下领域产生巨大影响:
- 对数据的战略依赖——良好的数据使企业保持运转。所有部门,包括营销、制造、管理和销售,都依赖于数据。从研究、现场和运营系统收集的信息有助于优化组织系统、改进产品和服务。通过数据沿袭提供的详细信息有助于更好地理解该数据的含义和有效性。
- 不断变化的数据——数据随着时间的推移而变化。收集和积累数据的新方法必须进行组合和分析,并由管理层使用来创造业务价值。数据沿袭提供跟踪功能,使协调和充分利用新旧数据集成为可能。
- 数据迁移——当 IT 需要将数据移动到新的存储设备或新的软件系统时,他们需要了解数据源的位置和生命周期。数据沿袭快速、轻松地提供这些信息,使迁移项目变得更容易、风险更低。
- 数据治理——数据沿袭中跟踪的详细信息是提供合规性审计、改进风险管理以及确保数据存储和处理符合组织政策和监管标准的好方法。
数据沿袭和数据分类
数据分类是根据用户配置的特征将数据分类的过程。
数据分类是信息安全和合规性计划的重要组成部分,特别是当组织存储大量数据时。它通过帮助了解敏感和受监管数据在本地和云中的存储位置,为数据安全策略奠定了坚实的基础。
此外,数据分类可以提高用户的工作效率和决策能力,删除不必要的数据,并降低存储和维护成本。
与数据沿袭结合时,数据分类尤其强大:
- 数据分类有助于定位敏感、机密、业务关键或符合合规性要求的数据。
- 对于这种性质的每个数据集,可以使用数据沿袭工具来调查其完整生命周期,发现完整性和安全问题并解决它们。
数据沿袭技术和示例
以下是一些用于对战略数据集执行数据沿袭的常用技术。
基于模式的谱系
该技术执行沿袭而不处理用于生成或转换数据的代码。它涉及表、列和业务报告的元数据评估。使用此元数据,它通过查找模式来调查沿袭。例如,如果两个数据集包含具有相似名称和非常数据值的列,则很可能在其生命周期的两个阶段中这是相同的数据。然后,这两列在数据沿袭图表中链接在一起。
基于模式的谱系的主要优点是它只监视数据,而不监视数据处理算法,因此它与技术无关。它可以以相同的方式在任何数据库技术中使用,无论是 Oracle、MySQL 还是 Spark。
缺点是这种方法并不总是准确的。在某些情况下,它可能会丢失数据集之间的连接,特别是当数据处理逻辑隐藏在编程代码中并且在人类可读的元数据中不明显时。
数据标记的沿袭
该技术基于这样的假设:转换引擎以某种方式标记或标记数据。为了发现谱系,它从头到尾跟踪标签。仅当您拥有控制所有数据移动的一致转换工具并且您了解该工具使用的标记结构时,此方法才有效。
即使存在这样的工具,通过数据标记的沿袭也不能应用于没有该工具生成或转换的任何数据。从这个意义上说,它只适合在封闭数据系统上执行数据沿袭。
自成一体的血统
一些组织拥有提供存储、处理逻辑和主数据管理 (MDM) 的数据环境,以对元数据进行集中控制。在许多情况下,这些环境包含一个数据湖,用于存储其生命周期各个阶段的所有数据。
这种类型的自包含系统本质上可以提供谱系,而不需要外部工具。然而,与数据标记方法一样,谱系将不知道在此受控环境之外发生的任何事情。
解析谱系
这是最高级的沿袭形式,它依赖于用于处理数据的自动读取逻辑。该技术对数据转换逻辑进行逆向工程,以执行全面的端到端跟踪。
该解决方案部署起来很复杂,因为它需要了解用于转换和移动数据的所有编程语言和工具。这可能包括提取-转换-加载 (ETL) 逻辑、基于 SQL 的解决方案、JAVA 解决方案、遗留数据格式、基于 XML 的解决方案等。
用于数据处理、摄取和查询的数据沿袭
在构建数据联动系统时,您需要跟踪系统中转换或处理数据的每个过程。数据转换的每个阶段都需要映射数据。您需要跨数据库和 ETL 作业跟踪表、视图、列和报告。
为了促进这一点,从每个步骤收集元数据,并将其存储在可用于谱系分析的元数据存储库中。
以下是在数据管道的不同阶段执行沿袭的方式:
- 数据摄取——跟踪数据摄取作业中的数据流,并检查源系统和目标系统之间的数据传输或映射中的错误。
- 数据处理——跟踪对数据执行的特定操作及其结果。例如,数据系统读取文本文件,应用过滤器,对特定列中的值进行计数,然后写入另一个表。每个数据处理阶段都经过单独分析,以识别错误或安全/合规违规行为。
- 查询历史记录——跟踪用户查询或从数据库和数据仓库等系统生成的自动报告。用户可以执行过滤、连接等操作,有效地创建新的数据集。这使得对重要查询和报告执行数据沿袭以验证流程数据变得至关重要。沿袭数据还可以帮助用户优化查询。
- 数据湖——跟踪用户对不同类型对象或不同数据字段的访问,并识别安全或治理问题。由于存在大量非结构化数据,在大型数据湖中实施这些问题可能会很复杂。
Imperva 数据保护解决方案
Imperva 提供数据发现和分类,揭示本地和云中数据的位置、数量和上下文。这可以帮助您识别关键数据集以执行详细的数据沿袭分析。
除了数据分类之外,Imperva 的数据安全解决方案还可以保护您的数据,无论其位于本地、云中还是混合环境中。它还使安全和 IT 团队能够全面了解数据在组织中的访问、使用和移动方式。
我们的综合方法依赖于多层保护,包括:
- 数据库防火墙— 阻止SQL 注入和其他威胁,同时评估已知漏洞。
- 用户权限管理——监控特权用户的数据访问和活动,以识别过多、不适当和未使用的权限。
- 数据脱敏和加密——混淆敏感数据,因此即使以某种方式提取,这些数据对于坏人来说也是无用的。
- 数据丢失防护(DLP) — 检查服务器、云存储或端点设备上的动态数据、静态数据。
- 用户行为分析——建立数据访问行为的基线,使用机器学习来检测异常和潜在风险活动并发出警报。
- 数据库活动监控——监控关系数据库、数据仓库、大数据和大型机,以生成有关策略违规的实时警报。
- 警报优先级排序——Imperva 使用人工智能和机器学习技术来查看安全事件流,并确定最重要事件的优先级。
