
【免费下载链接】ai-infra-engineer-learningAI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)项目地址https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning点击查看免费下载ai-infra-engineer-learning 开源课程中的 mod-105 数据管道模块系统讲解如何用Apache Airflow 编排工作流、Apache Spark 做批处理、Apache Kafka 做流式处理手把手带你搭建一套可复用的生产级 ML 数据管道。无论你是刚入门的数据工程师还是想补齐 ML 基础设施短板的算法工程师这份实战指南都能在约 45 小时内帮你打通数据入湖 → 质量校验 → 特征加工 → 模型训练触发的完整链路。为什么 ML 数据管道需要这三件套数据是 ML 模型的地基而手动准备数据根本无法规模化。业界头部公司Uber、Airbnb、Spotify 等都在大量使用 Airflow Spark 的组合来支撑推荐、定价、反欺诈等模型。组件角色定位解决的核心问题Apache Airflow工作流编排引擎任务调度、依赖管理、失败重试、可视化监控Apache Spark分布式批处理引擎单机内存装不下的 TB 级数据清洗与特征工程Apache Kafka分布式流式平台毫秒级实时事件摄入与实时特征计算三者的分工非常清晰**Airflow 是大脑**负责编排**Spark 是肌肉**负责重体力活**Kafka 是神经**负责实时信号传输。快速开始克隆课程仓库并定位数据管道模块git clone https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning克隆完成后直接打开模块总览mod-105 数据管道模块 README。该模块预估总投入约 45 小时12 小时课程 20 小时实战项目 13 小时阅读练习技术栈版本为 Airflow 2.7、Spark 3.4PySpark、Kafka 3.5。学习路线图8节课 6个实验 12个练习先建立全局认知再分步深入这是本模块的学习节奏️架构设计01-data-pipeline-architecture.md —— 理解 ML 管道的六个阶段数据源 → 摄入 → 校验 → 转换 → 特征工程 → 训练区分批处理与流式两种架构Airflow 基础02-apache-airflow-fundamentals.md —— 掌握 Web Server、Scheduler、元数据库、Executor 四大组件写出第一个 DAGAirflow 进阶03-advanced-airflow-ml.md —— TaskFlow API、XCom 传递、条件分支、ML 专用 Operator数据版本化04-data-versioning-dvc.md —— 用 DVC 像管理代码一样管理数据集Spark 批处理05-data-processing-spark.md —— Driver/Executor 架构、DataFrame API、K8s 上运行 SparkKafka 流式06-streaming-data-kafka.md —— Topic、分区、生产者/消费者、实时特征工程数据质量07-data-quality-validation.md —— Great Expectations 校验、Schema 漂移检测监控与容错08-pipeline-monitoring-errors.md —— 告警、重试、死信队列、SLA 监控配套动手资源实验labs/ 目录下 6 个 lab从本地 Airflow 到 Spark 作业、Kafka 流式事件️练习exercises/ 目录下 12 个循序渐进的练习含进阶挑战✏️自测quizzes/module-quiz.md 共 25 题80% 及格第一步用 Airflow 编排你的第一条 ML 管道Airflow 是 ML 基础设施中使用最广泛的工作流引擎——Airbnb 运营 1000 DAGSpotify 超过 5000 个。本地 30 分钟跑起来跟随 lab-01-airflow-local.md用 docker-compose 一键拉起 scheduler webserver worker Postgres打开http://localhost:8080即可看到调度界面。写出生产级 DAGexercise-02-airflow-fundamentals/README.md 要求你用 TaskFlow API 构建一个完整的模型训练 DAG覆盖 6 个关键生产要素✅ 数据质量驱动的条件分支达标才部署✅ 指数退避重试与 4 小时SLA告警✅动态任务映射实现特征工程并行✅ **传感器Sensor**等待上游 S3 数据落盘掌握这些惯用法后你写出的管道才经得起团队协作和长期维护。第二步用 Spark 处理单机装不下的训练数据当数据量超过单机内存pandas 就会罢工这时 Spark 的分布式能力就是最优解内存处理比 MapReduce 快约 100 倍且能从笔记本平滑扩展到千节点集群。⚡跟着 lab 走一遍完整流程lab-03-spark-job.md 以纽约出租车数据集为例体验读 Parquet → 按日期聚合 → 写出分区 Parquet的标准批处理模式。性能调优实战exercise-05-spark-batch-processing/README.md 要求处理 1-10 GB 的真实数据集并重点掌握两个省钱省时的关键技巧广播 Join vs Shuffle Join小维度表用广播避免昂贵的数据 shuffle分区与桶化写出按日期分区 按用户分桶让下游查询飞快第三步用 Kafka 打通实时数据链路批处理管道跑在 6 小时一个周期反欺诈场景根本等不起。Kafka 正是为此而生百万级消息/秒吞吐、亚毫秒延迟、持久化副本保障故障恢复。最小可用环境lab-04-kafka-streaming.md 用 KRaft 模式无需 ZooKeeper在本地跑起 Kafka创建 3 分区 Topic并用 Python 生产/消费消息亲眼观察分区行为。进阶到生产级实时特征管道exercise-03-streaming-pipeline-kafka/README.md 是一个完整的电商反欺诈场景——构建 100ms 延迟的实时特征工程管道实现 exactly-once 语义、乱序事件水位线处理以及在线推理的毫秒级特征服务彻底解决训练-服务特征不一致train/serve skew这一经典痛点。第四步质量校验 监控告警 端到端项目生产管道 编排 计算 流式 质量门禁可观测性缺一不可。️数据质量学习用 Great Expectations 定义列存在性、空值、取值范围等断言把质量检查做成管道的守门员监控容错为管道配置指标、日志、告警三支柱学会用死信队列和熔断器优雅处理失败最后把全部技能合龙到 project-102-mlops-pipeline一个覆盖数据摄入 → DVC 版本化 → 自动训练 → MLflow 实验跟踪 → 模型注册 → 持续部署的端到端 MLOps 项目。其中 training_pipeline.py 展示了训练 DAG 如何根据评估指标自动把模型晋升到 Staging/Production并触发下游部署管道——这正是数据管道与模型运维的交汇点。学习建议如何高效完成本模块阶段建议路径预计耗时入门lab-01Airflow 本地→ lab-03Spark 作业→ lab-04Kafka 流式3-4 小时进阶exercise-02Airflow DAG→ exercise-05Spark 调优6-8 小时精通exercise-03Kafka 实时特征 project-102端到端 MLOps30 小时三条实操建议每个 lab 都完整敲一遍命令不要只读文档——管道的感觉是跑出来的用 module-quiz 的 25 题自测80 分以下建议回看对应课时需要更多学习资源时查阅 resources.md内含 Airflow、Spark、Kafka、DVC 的官方文档索引完成 mod-105 后你的技能画像将直接对标 Data Engineer 与 ML Infrastructure Engineer 岗位需求也能为后续 MLOpsmod-106和 GPU 计算mod-107模块打下坚实基础。赞分享【免费下载链接】ai-infra-engineer-learningAI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)项目地址https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning点击查看免费下载相关推荐ML应用的Docker镜像瘦身术ai-infra-engineer-learning中的多阶段构建、BuildKit与GPU容器实战ML应用的Docker镜像瘦身术ai infra engineer learning中的多阶段构建、BuildKit与GPU容器实战 如果你正在学习 AI 基从零开始构建LLM数据管道data-engineer-handbook的完整实践指南从零开始构建LLM数据管道data engineer handbook的完整实践指南 data engineer handbook是一个全面的开源资源库旨在数据工程文档教程dlt REST API Source用 dltHub AI Harness 构建生产级 REST API 数据管道dlt REST API Source用 dltHub AI Harness 构建生产级 REST API 数据管道 本篇指南聚焦于 rest api pip数据工程数据集成批处理创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考