流集数据收集器配置:使用数据治理工具

本文介绍了如何配置数据收集器以与数据治理工具集成,如Cloudera Navigator和Apache Atlas,用于发布管道元数据,实现数据的追踪和治理。内容涵盖了集成的先决条件、安装阶段库、配置连接以及查看发布的元数据。

使用数据治理工具

您可以将数据收集器配置为与数据治理工具集成,从而了解数据移动 - 数据来自何处、将要去哪里以及谁在与之交互。

数据治理工具集成可通过付费订阅获得。有关详细信息,请联系流集

数据收集器可以使用以下数据治理工具:

Cloudera Navigator

如果您使用云端管理器并安装了云端导航器,则可以将数据收集器配置为将有关正在运行的管道的元数据发布到云端导航器。发布元数据时,数据收集器使用基本身份验证向云传送导航器发出 HTTPS 请求。数据以 JSON 格式发送。

阿帕奇地图集

如果您安装了 Apache 地图集,则可以配置数据收集器以将有关正在运行的管道的元数据发布到阿帕奇地图集。发布元数据时,数据收集器使用阿帕奇卡将元数据发送到阿帕奇地图集。数据以 JSON 格式发送。

然后,您可以使用云端导航器或 Apache 地图集浏览管道元数据,包括查看元数据的谱系图。

数据收集器使用单独的线程将元数据发布到数据治理工具 , 因此启用元数据发布对正在运行的管道线程的影响最小。每个管道在管道启动和停止时发布元数据。某些源和目标仅发布元数据一次,通常是在初始化时。但是,某些阶段在每次创建新对象时都会发布元数据 - 例如,当 Hadoop FS 或本地 FS 目标创建新的输出文件时。

支持的阶段

目前,只有某些管道阶段支持将元数据发布到数据治理工具。

数据收集器发布所有正在运行的管道中所有受支持阶段的元数据。如果有多个运行管道的数据收集器,请将每个数据收集器配置为将元数据发布到同一治理工具实例。

数据收集器可以发布以下阶段的元数据:
  • 亚马逊 S3 源
  • 开发数据生成器源
  • 目录来源
  • 哈多普FS起源
  • JDBC 查询消费者源
  • 卡夫卡消费者起源
  • 卡夫卡多主题消费者起源
  • 客户端来源
  • 哈多普 FS 目的地
  • 本地金融服务目的地
  • 总部基地目的地
  • 配置单元流式处理目标
  • 卡夫卡生产者目的地
  • 库杜目的地
注意:请记住,不要在阶段级别甚至管道级别启用元数据发布。只需将数据收集器配置为发布所有正在运行的管道的元数据即可。

当管道包含不受支持的阶段时,数据调控工具不会在沿袭图中将该阶段显示为输入或输出。例如,如果正在运行的管道包含不受支持的源和 Hadoop FS 目标,则数据调控工具会将管道显示为具有 0 个输入和多个输出 - 每个生成的输出文件对应一个输出。如果正在运行的管道不包含任何受支持的源或目标,则数据调控工具会将管道显示为具有 0 个输入和 0 个输出。

Cloudera Navigator

您可以将数据收集器配置为将有关正在运行的管道的元数据发布到 Cloudera 导航器。然后,使用 Cloudera 导航器浏览管道元数据,包括查看元数据的沿袭图。

数据治理工具集成可通过付费订阅获得。有关详细信息,请联系流集

要将数据收集器与云端导航器集成,请下载云端导航器舞台库并将其安装为自定义舞台库。然后,将数据收集器配置为连接到云传送导航器。

先决条件

在启用数据收集器将管道元数据发布到 Cloudera 导航器之前,必须满足以下先决条件:

验证数据收集器是否安装了所需的 Cloudera CDH 阶段库版本。

要连接到云端导航器并将其发布到云端导航器,数据收集器需要云端管理器 - 支持版本 5.10 到 5.15。

要验证数据收集器是否安装了有效的 Cloudera CDH 舞台库,请单击程序包管理器图标 () 以显示已安装阶段库的列表。如果未安装所需的库版本,请在配置数据收集器以将管道元数据发布到 Cloudera 导航器之前安装库

将云传送导航器数据管理角色添加到您的云传送管理器集群。

将以下导航员角色添加到 Cloudera 管理服务:
  • Cloudera 导航器审核服务器角色
  • Cloudera 导航器元数据服务器角色

有关说明,请参阅云端管理器文档。

步骤 1.下载并安装舞台库

下载并安装 Cloudera 导航器舞台库作为自定义舞台库

  1. 使用您从 StreamSets 收到的电子邮件中提供的链接,下载包含适用于您的云端管理器版本的云端导航器阶段库的压缩包。
    例如,如果数据收集器安装了 Cloudera CDH 舞台库版本 5.14,请下载 流集数据收集器cm_5_14-lib-1.3.0.tgz 文件。
  2. 解压缩压缩包。
    压缩包被解压缩到以下目录中:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code><stage library name>/lib/</code></span></span>
    例如:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>streamsets-datacollector-cm_5_14-lib/lib/</code></span></span>
  3. 在运行数据收集器的每个节点上,为自定义阶段库创建一个本地目录。
    例如,您可以在以下位置创建自定义舞台库目录:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs</code></span></span>
  4. 在运行数据收集器的每个节点上,将提取的 Cloudera 导航器阶段库复制到为USER_LIBRARIES_DIR环境变量定义的目录中,如下所示:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs/<stage library name>/lib/</code></span></span>
    例如:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs/streamsets-datacollector-cm_5_14-lib/lib/</code></span></span>
  5. 在云端管理器中,选择流集服务,然后单击配置
  6. “配置”页上的“数据收集器高级配置代码段(sdc-env.sh 安全阀)”字段中,添加USER_LIBRARIES_DIR环境变量并将其指向自定义舞台库目录,如下所示:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export USER_LIBRARIES_DIR="<custom stage library directory>"</code></span></span>
    例如:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export USER_LIBRARIES_DIR="/opt/sdc-user-libs/"</code></span></span>
  7. 使用缺省情况下启用的 Java 安全性管理器时,请更新数据收集器高级配置代码段(安全阀)for sdc-security.policy 属性以包含定制阶段库目录,如下所示:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>// custom stage library directory
    grant codebase "file://<custom stage library directory>/-" {
       permission java.security.AllPermission;
    };</code></span></span>
    例如:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>// custom stage library directory
    grant codebase "file:///opt/sdc-user-libs/-" {
       permission java.security.AllPermission;
    };</code></span></span>
  8. 重新启动数据收集器。

步骤2.配置与云端导航器的连接

将沿袭发布者属性添加到数据收集器配置文件中,$SDC_CONF/sdc.属性,然后根据需要配置这些属性。使用云端管理器管理数据收集器时,请通过云端管理器中的 StreamSets 服务配置数据收集器配置属性。对配置文件的手动更改可以被云端管理器覆盖。

重要:无需在配置文件中输入敏感数据(如明文形式的密码),而是可以通过将数据存储在外部位置,然后使用函数检索 数据来保护敏感数据。

配置属性包括启用元数据发布和定义与 Cloudera 导航器的连接。

如果为 TLS/SSL 配置了 Cloudera 导航器,则配置属性还需要指定数据收集器用于验证 Cloudera 导航器元数据服务器身份的本地信任库文件。

警告:如果启用了元数据发布,并且数据收集器无法在启动时连接到 Cloudera 导航器,则数据收集器将无法启动。
  1. 若要启用元数据发布,请将以下行添加到 sdc.properties 文件中:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code># Lineage Publisher
    #
    lineage.publishers=navigator
    lineage.publisher.navigator.def=streamsets-datacollector-cm_5_14-lib::com_streamsets_pipeline_stage_plugin_navigator_NavigatorLineagePublisher
    lineage.publisher.navigator.config.application_url=http://localhost:18630
    lineage.publisher.navigator.config.navigator_url=http://navigatorhost:7187
    lineage.publisher.navigator.config.namespace=sdc
    lineage.publisher.navigator.config.username=user
    lineage.publisher.navigator.config.password=passwd
    lineage.publisher.navigator.config.autocommit=false</code></span></span>
  2. 要定义与 Cloudera 导航器的连接,请修改以下属性的默认值:
    元数据发布者属性描述: __________
    世系出版商要将元数据发布到的应用程序。不要更改 的默认值。navigator
    世系.publisher.navigator.def用于连接到 Cloudera 导航器的舞台库名称,按以下格式输入:

    <stage library name>::com_streamsets_pipeline_ stage_plugin_navigator_NavigatorLineagePublisher

    定义适当的 Cloudera CDH 阶段库名称以启用元数据发布。例如,如果下载了 5.14 版的舞台库,请按如下方式定义舞台库名称:
    <span style="color:#333333"><code>streamsets-datacollector-cm_5_14-lib</code></span>

    不要修改属性值的后半部分。

    世系.publisher.navigator.

    config.application_url

    指向数据收集器的 URL。例如:

    http://<hostname>:18630/

    世系.publisher.navigator.

    config.navigator_url

    指向 Cloudera 导航器 UI 的 URL。例如:

    http://<Navigator Metadata Server host>:<port number>/

    <Navigator Metadata Server host>是运行导航器元数据服务器角色的主机的名称。 是为角色配置的端口。<port number>

    世系.publisher.navigator.

    配置命名空间

    Cloudera 导航器用于唯一标识数据收集器属性的命名空间。
    世系.publisher.navigator.

    配置用户名

    用于连接到 Cloudera 导航器的用户名。
    世系.publisher.navigator.

    配置密码

    云端导航器帐户的密码。

    若要保护密码,请将密码存储在外部位置,然后使用函数检索密码。

    世系.publisher.navigator.

    配置.自动提交

    使云传送导航器能够立即处理已发布的元数据。

    在大多数情况下,请使用默认值 false。设置为 true 可以使用 Cloudera 导航器计算机上的大量资源。

  3. 如果云端导航器配置为 TLS/SSL,请将以下行添加到 sdc.properties 文件的“世系发布者”部分,然后修改属性的默认值:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>lineage.publisher.navigator.config.ssl_truststore_location=truststore.jks
    lineage.publisher.navigator.config.ssl_truststore_password=changeit</code></span></span>
    TLS/SSL 的元数据发布者属性描述: __________
    世系.publisher.navigator.

    config.ssl_truststore_location

    包含 Cloudera 导航器元数据服务器证书的信任库文件的路径。

    输入文件的绝对路径或相对于数据收集器资源目录的路径:。$SDC_RESOURCES

    世系.publisher.navigator.

    config.ssl_truststore_password

    信任库文件的密码。

    若要保护密码,请将密码存储在外部位置,然后使用函数检索密码。

  4. 重新启动数据收集器以使更改的属性生效。

查看已发布的元数据

您可以在 Cloudera 导航器中近乎实时地查看已发布的管道元数据。Cloudera 导航器按管道标题列出每个管道,并将支持的源显示为输入,将支持的目标显示为输出。Cloudera 导航器还包括数据收集器中管道的 URL 以及其他元数据,例如管道描述、标签、版本和启动管道的用户。

例如,假设您运行的管道包含 JDBC 查询使用者源和本地 FS 目标。云传送导航器显示表示 JDBC 查询使用者源的单个输入。管道运行时,本地 FS 目标将创建多个输出文件。Cloudera 导航器显示多个输出,每个输出代表一个生成的输出文件。

Cloudera 导航器显示已发布管道元数据的详细信息,如下所示。请注意我们的示例 Jdbc2LocalFS 管道是如何列出 1 个输入和 42 个输出的 - 每个生成的输出文件对应一个输出:

云端导航器示管道沿袭图如下:

阿帕奇地图集

您可以将数据收集器配置为将有关正在运行的管道的元数据发布到 Apache Atlas。然后,使用 Apache 地图集浏览管道元数据,包括查看元数据的谱系图。

数据治理工具集成可通过付费订阅获得。有关详细信息,请联系流集

要将数据收集器与阿帕奇地图集集成,请下载并安装以下阿帕奇阿特拉斯舞台库之一作为自定义舞台库:
  • 流集-数据收集器-阿帕奇-atlas_0_8_1-库 - 在使用 HDP 版本 2.6.x 和阿帕奇阿特拉斯 0.8.1 时使用。
  • 流集-数据收集器-阿帕奇-atlas_1_1_0-库 - 在使用 HDP 版本 3.1.x 和阿帕奇阿特拉斯 1.1.0 时使用。

然后,将数据收集器配置为连接到阿帕奇地图集。您还必须将流集数据模型部署到安装了阿帕奇地图集服务器的计算机。

先决条件

在启用数据收集器将管道元数据发布到 Apache Atlas 之前,必须满足以下先决条件:

验证数据收集器是否安装了所需的霍顿沃斯数据平台 (HDP) 载物台库。

要连接到阿帕奇地图集并将其发布到阿帕奇地图集,数据收集器需要 HDP 版本 2.6.x 或 3.1.x。

若要验证数据收集器是否安装了有效的 HDP 阶段库,请单击“程序包管理器”图标 () 以显示已安装阶段库的列表。如果未安装所需的库版本,请在配置数据收集器以将管道元数据发布到 Apache Atlas 之前安装库

在阿帕奇地图集中配置所需的设置。

要连接到阿帕奇地图集并将其发布到阿帕奇地图集,您必须在阿帕奇地图集中配置以下必需的设置:
  • 配置阿帕奇地图集以使用 HBase 作为持久性引擎。
  • 将阿帕奇地图集配置为使用阿帕奇卡夫卡接收通知。
  • 确保为阿帕奇地图集启用了绘图引擎。

有关配置阿帕奇地图集的更多信息,请参阅阿帕奇地图集文档

步骤 1.下载并安装舞台库

下载并安装相应的 Apache 阿特拉斯舞台库作为自定义舞台库

  1. 使用您从 StreamSets 收到的电子邮件中提供的链接,下载包含 Apache 阿特拉斯舞台库的压缩包。
  2. 解压缩压缩包。
    压缩包被解压缩到以下目录中:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code><stage library name>/lib/</code></span></span>
    例如,将阿帕奇地图集 0.8.1 版舞台库提取为:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>streamsets-datacollector-apache-atlas_0_8_1-lib/lib/</code></span></span>
    阿帕奇地图集 1.1.0 版舞台库被提取为:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>streamsets-datacollector-apache-atlas_1_1_0-lib/lib/</code></span></span>
  3. 为自定义舞台库创建数据收集器安装目录外部的本地目录。使用外部目录在数据收集器升级后允许使用这些库。
    例如,如果将数据收集器安装在以下目录中:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc/</code></span></span>
    您可以在以下位置创建自定义舞台库目录:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs</code></span></span>
  4. 将 Apache 阿帕奇阿特拉斯舞台库复制到此自定义舞台库目录,如下所示:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs/<stage library name>/lib/</code></span></span>
    例如,对于阿帕奇阿特拉斯版本0.8.1:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs/streamsets-datacollector-apache-atlas_0_8_1-lib/lib/</code></span></span>
    对于阿帕奇阿特拉斯版本1.1.0:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/opt/sdc-user-libs/streamsets-datacollector-apache-atlas_1_1_0-lib/lib/</code></span></span>
  5. 将USER_LIBRARIES_DIR环境变量添加到相应的文件,并将其指向自定义舞台库目录。

    使用安装类型所需的方法修改环境变量

    按如下方式设置环境变量:

    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export USER_LIBRARIES_DIR="<custom stage library directory>"</code></span></span>

    例如:

    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export USER_LIBRARIES_DIR="/opt/sdc-user-libs/"</code></span></span>
  6. 使用缺省情况下启用的 Java 安全管理器时,请更新数据收集器安全性策略以包括定制阶段库目录,如下所示:
    1. 在数据收集器配置目录中,打开安全策略文件:
      <span style="color:#333333"><span style="background-color:#eeeeee"><code>$SDC_CONF/sdc-security.policy</code></span></span>
    2. 将以下行添加到文件中:
      <span style="color:#333333"><span style="background-color:#eeeeee"><code>// custom stage library directory
      grant codebase "file://<custom stage library directory>/-" {
         permission java.security.AllPermission;
      };</code></span></span>
      注意:必须在目录名称后包含尾随 的 /-
      例如:
      <span style="color:#333333"><span style="background-color:#eeeeee"><code>// custom stage library directory
      grant codebase "file:///opt/sdc-user-libs/-" {
         permission java.security.AllPermission;
      };</code></span></span>
  7. 重新启动数据收集器。

步骤2.配置与阿帕奇地图集的连接

配置数据收集器以连接到 Apache 地图集涉及使用以下文件:

数据收集器配置文件

将沿袭发布者属性添加到数据收集器配置文件,$SDC_CONF/sdc.属性

阿帕奇地图集应用程序属性文件

如果数据收集器安装在与 Apache Atlas 服务器不同的计算机上,请将 atlas-application.properties 文件复制到数据收集器计算机上。根据需要修改 Apache Atlas 应用程序属性文件,然后在数据收集器计算机上的SDC_JAVA_OPTS环境变量中指定该文件的位置。

警告:如果启用了元数据发布,并且 Apache 阿特拉斯无法在数据收集器启动时访问  atlas-application.properties 文件,则数据收集器将无法启动。
  1. 要启用元数据发布到阿帕奇阿特拉斯,请修改数据收集器配置文件,$SDC_CONF/sdc.属性

    对于 Apache 阿特拉斯版本 0.8.1,请将以下行添加到文件中:

    <span style="color:#333333"><span style="background-color:#eeeeee"><code># Lineage Publisher
    #
    lineage.publishers=atlas
    lineage.publisher.atlas.def=streamsets-datacollector-apache-atlas_0_8_1-lib::com_streamsets_pipeline_stage_plugin_atlas_AtlasLineagePublisher</code></span></span>
    对于 Apache 阿特拉斯版本 1.1.0,请将以下行添加到文件中:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code># Lineage Publisher
    #
    lineage.publishers=atlas
    lineage.publisher.atlas.def=streamsets-datacollector-apache-atlas_1_1_0-lib::com_streamsets_pipeline_stage_plugin_atlas_AtlasLineagePublisher1_1_0</code></span></span>
  2. 如果数据收集器安装在与 Apache Atlas 服务器不同的计算机上,请将 atlas-application.properties 文件复制到数据收集器计算机上。

    流集建议将 atlas-application.properties 文件存储在 $SDC_CONF 目录中。例如,对于数据收集器的 RPM 安装,请将文件存储在 /etc/sdc/ 目录中。

  3. 验证是否正确配置了 atlas-应用程序 .properties 文件。
    例如,如果将  atlas-application.properties 文件复制到数据收集器计算机,则可能需要修改以下属性,这些属性指定在 Apache Atlas 服务器上安装 Kafka:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>atlas.kafka.zookeeper.connect=localhost:9026
    atlas.kafka.bootstrap.servers=localhost:9027</code></span></span>

    有关此文件中的属性的详细信息,请参阅 Apache 地图集文档

  4. 在数据收集器计算机上,在SDC_JAVA_OPTS环境变量中定义 -Datlas.conf 系统属性。

    使用安装类型所需的方法修改环境变量

    -Datlas.conf 系统属性定义本地地图集应用程序属性文件的位置。按如下方式定义阿特拉斯系统属性:

    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export SDC_JAVA_OPTS="${SDC_JAVA_OPTS} -Datlas.conf=<configuration directory> -Xmx1024m  -Xms1024m -server"</code></span></span>
    定义的配置目录必须以正斜杠 (/) 结尾。例如,如果将文件存储在数据收集器 RPM 安装的 $SDC_CONF 目录中,请按如下方式定义 Atlas 系统属性:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>export SDC_JAVA_OPTS="${SDC_JAVA_OPTS} -Datlas.conf=/etc/sdc/ -Xmx1024m  -Xms1024m -server"</code></span></span>
  5. 重新启动数据收集器以使更改的属性生效。

第3步.将流集数据模型部署到阿帕奇地图集

下载流集数据模型并将数据模型部署到阿帕奇地图集服务器。

  1. 使用您从流集收到的电子邮件中提供的链接,下载阿帕奇地图集的流集数据模型:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>0090-streamsets_model.json</code></span></span>
  2. 将数据模型部署到安装了阿帕奇阿特拉斯服务器的机器上。
    在阿帕奇阿特拉斯服务器上,将流集数据模型复制到包含 Sqoop 数据模型的同一目录中。
    例如,如果使用 Hortonworks 版本 2.6.1 进行测试,请将流集数据模型复制到以下目录:
    <span style="color:#333333"><span style="background-color:#eeeeee"><code>/usr/hdp/2.6.1.0-129/atlas/models/0090-streamsets_model.json</code></span></span>
  3. 重新启动 Apache Atlas 服务器,以便服务器可以识别新部署的数据模型。

查看已发布的元数据

数据收集器会在管道停止时将管道元数据发布到 Apache Atlas。Apache Atlas 按管道标题列出每个管道,并将支持的原点显示为输入,将支持的目标显示为输出。Apache Atlas 还包括其他元数据,例如管道描述、标签、版本和启动管道的用户。

例如,假设您运行的管道包含 JDBC 查询使用者源和本地 FS 目标。阿帕奇地图集显示表示 JDBC 查询使用者源的单个输入。管道运行时,本地 FS 目标将创建多个输出文件。Apache地图集显示多个输出,每个输出代表一个生成的输出文件。

Apache 地图集显示已发布管道元数据的详细信息,如下所示。请注意我们的示例管道是如何列出 1 个输入和 3 个输出的 - 每个生成的输出文件对应一个输出:

阿帕奇地图集显示管道谱系图如下:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

JAVASoftEngineer

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值