尧图精选

DataHub 元数据管理平台快速上手:一行命令部署与 3 个典型摄入任务

🕒 发布时间:2026/9/13 2:08:49 📁 来源:尧图网络
DataHub 元数据管理平台快速上手一行命令部署与 3 个典型摄入任务【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub周五晚上有张表被删了没人说得清是谁操作的、影响哪些下游任务。这类元数据说不清的问题正是 DataHub 要解决的。DataHub 是面向数据和 AI 栈的元数据管理平台把 Snowflake、BigQuery、Airflow 等数据源的表结构、所有权、血缘等元数据统一摄入到一个可搜索、可治理的目录里。本文从最短部署路径讲起再带你完成三个典型任务加载示例数据、命令行搜索、接入真实数据源全程可复制跟做。先认识整体DataHub 的定位一句话数据栈的户口本负责采集、存储和展示所有数据资产的元数据。组件职责GMS元数据服务处理增删改查维护实体关系端口 8080MySQL持久化版本化元数据OpenSearch提供全文与语义搜索Kafka元数据变更事件的流转通道Web Frontend浏览、搜索、血缘可视化端口 9002最短路径跑起来第 1 步环境自检。需要 Docker Compose v2 和 Python 3.10Docker 至少分配 8GB 内存docker compose version # 确认 Compose v2 python3 --version # 需 3.10 及以上第 2 步安装 CLI 并一行启动。首次拉镜像约需 10 分钟python3 -m pip install --upgrade acryl-datahub # 安装 DataHub CLI datahub docker quickstart # 一键部署整套实例第 3 步验证通过。标准是三条都成立终端出现✔ DataHub is now running浏览器打开http://localhost:9002用默认账号datahub/ 密码datahub登录成功datahub docker check全部容器健康完成 3 个典型任务任务一加载示例数据先看到完整的目录长什么样任务目标本地实例里出现上千个带血缘和标签的实体。操作步骤datahub init --username datahub --password datahub # CLI 指向本地实例 datahub datapack load showcase-ecommerce # 加载演示数据包结果验证UI 搜索任意数据集名能看到 Schema、Documentation、Lineage 等标签页。数据包覆盖 Snowflake、Looker、PowerBI 等约 1050 个实体datapack目前是实验性命令行为以项目最新版本为准。任务二用命令行完成数据集发现任务目标不打开浏览器在终端完成关键词搜索和过滤。操作步骤datahub search users # 关键词搜索 datahub search * --filter platformsnowflake --filter entity_typedataset结果验证第二条命令只返回 Snowflake 上的 dataset 实体。语义搜索可用datahub search --semantic 关键词需要服务端启用语义索引。任务三接入一个真实数据源以 Snowflake 为例任务目标把生产 Snowflake 的表和血缘同步进 DataHub。操作步骤新建 recipe 文件完整示例见 metadata-ingestion/examples/recipes/snowflake_to_datahub.dhub.yamlsource: type: snowflake config: env: PROD # 自定义环境标识用于区分多套实例 account_id: account_name # Snowflake 账号 ID warehouse: COMPUTE_WH # 读取元数据所用仓库 username: user password: pass sink: type: datahub-rest # 走 REST 直连本地 GMS config: server: http://localhost:8080执行datahub ingest your_recipe.yml结果验证UI 中该数据集出现 Schema 页签且查询血缘能追溯到来源任务类似下图的跨平台血缘视图。高频配置详解配置项作用常见取值source.config.database_pattern按数据库名过滤allow: [ANALYTICS]source.config.schema_pattern按模式/库过滤allow: [CUSTOMER_360]source.config.top_n_queries摄入最近 N 条查询补血缘10source.config.env环境标识区分多套实例PROD/DEVsink.type元数据投递方式datahub-rest或datahub-kafkasource.config.classification.enabled启用内置分类如 PII 识别true真实场景你只关心ANALYTICS库里CUSTOMER_360模式下的表同时希望保留最近 10 条查询用于血缘那么 recipe 里加三行即可——database_pattern.allow: [ANALYTICS]、schema_pattern.allow: [CUSTOMER_360]、top_n_queries: 10。这样摄入耗时和存储量都会明显下降。踩坑清单与生产建议症状根因处理command not found: datahubpip 的~/.local/bin不在 PATH改用python3 -m datahub ...或把目录加入 PATH启动时报端口被占用3306/9200/9092/8080/9002 默认端口冲突用datahub docker quickstart --mysql-port 53306等参数覆盖GMS 端口用环境变量DATAHUB_MAPPED_GMS_PORTApple Silicon 报no matching manifestCLI 未识别 M 系列芯片架构datahub docker quickstart --arch m1容器残留、卷冲突之前部署的悬空容器docker system prune后重新 quickstart数据在但搜索无结果搜索索引与主存储不同步datahub docker quickstart --restore-indices重建索引生产环境检查三项quickstart 明确不用于生产默认凭据、端口全暴露生产部署走 Kubernetes见 docs/deploy/kubernetes.md上线前修改默认datahub/datahub凭据并启用元数据服务认证参考 docs/authentication/备份习惯养成datahub docker quickstart --backup导出 MySQL恢复用--restore扩展资源快速开始与实例管理docs/quickstart.md摄入源文档与示例 recipemetadata-ingestion/UI 方式管理摄入源docs/ui-ingestion.mdQuickstart 排障手册docs/troubleshooting/quickstart.md社区入口DataHub Slack 社区加入方式见 docs/quickstart.md 结尾提示【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →