一人数仓 · 极简通关指南

SQL为王 · 编排为纲 · 编程为辅
不卷 Flink,不背 Java,只用 SQL + 编排,一个人扛住百亿实时流量
⚡ 一、本星球的“反常识”信仰 必读3遍

在开始之前,请彻底忘掉传统大数据团队的“高门槛”:

❌ 传统认知:实时数仓必须学 Java/Scala 写 Flink ✅ 真实玩法:用 Doris [Routine Load | Stream Load] 替代 Flink,无需背负沉重的框架。
❌ 传统认知:需要精通复杂的数据采集 ✅ 真实玩法:Python 构建极简接口(复制模板改改就行),或者读取日志文件。
❌ 传统认知:需要运维庞大且复杂的 Hadoop/HBase 集群 ✅ 真实玩法:直接使用云计算框架,存算分离,无需运维,成本极低。
❌ 传统认知:分析师只能等开发排期做报表 ✅ 真实玩法:分析师自己通过使用SQL在Metabase构建任意报表,甚至无需SQL,直接拖拽字段即可构建图表。
🎯 核心能力矩阵:
SQL 能力(占比 70%) → 所有数据导入、清洗、聚合、宽表构建。
流程编排能力(占比 20%) → 调度任务(crontab,海豚)、监控依赖、数据对账。
编程能力(占比 10%) → 使用我们提供的 FastAPI 采集框架模板,改改字段名即可。(含二开和修改说明)
👥 二、双角色定制路线 请对号上车

新同学最容易犯的错是“什么都想学”。请严格按你的当前身份选择 主攻路径

👨‍💻 路线 A:传统数仓 / 后端开发

  • 你的舒适区:环境搭建、接口编写、资源调优。
  • 你需要猛攻的短板:Doris SQL 高级玩法(窗口函数、Bitmap)和 数据建模
  • 学习节奏:花 20% 时间搭环境,80% 时间死磕第二阶段(数据清洗)的 SQL,把编程思维转化为集合思维。
  • 学习的必要性:传统传统大数据开发流程繁琐,框架臃肿,效率低。在AI时代的背景下,业务部门往往当日下的需求当日就要拿到结果。传统大数据架构往往有着不可承受的效率之“重”,为相应的业务选择合适的工具和流程才是提高效率的最优解。

👩‍💻 路线 B:数据分析师 / BI

  • 你的舒适区:写复杂查询、懂业务指标、做报表。
  • 你需要猛攻的短板:Routine Load 和Stream Load原理、Doris 表模型选型(Duplicate/Aggregate/Unique)、调度编排
  • 学习节奏:完全跳过 FastAPI 代码细节(直接拿成品),直接接管 Doris 内所有表的构建,自行通过metabase构建报表,无需等待,你将是这个数仓的 绝对核心(数据掌印官)
  • 学习的必要性:分析业务日渐AI化,分析师得有更多硬技能傍身,因为AI化分析的前提,需要有标准化和规范化的数据和流程。
🗺️ 三、四阶闯关路线图 从 0 到 “一个人就是一支团队”

每关都标注了 “SQL 占比”“编排动作”,让你清晰感知自己的成长。

🟢 第一关:管道搭建

目标:把数据“接”进来 · 1周
花最低成本,让百亿级日志从源头流进 Doris。
你的动作技术选型SQL 占比关键产出
采集(2选1) ① FastAPI 写1个Http接口(复制星主模板)
② Filebeat 直接监听日志文件(零代码推荐
0% 数据进入 Kafka
入仓(核心) 配置 Doris Routine Load,把 Kafka JSON 映射到 ODS 表 10%(只需建表SQL) 数据实时入库,延迟 ≤ 10秒
成本控制 Doris 表设置 动态分区 + 冷热分离(SSD存3天,HDD存历史) 10% 存储成本直降 70%
编排动作 写一个 Shell 脚本 + Crontab,每小时检查 Kafka Lag 积压数 积压告警基础
💡 星主经验:这一关最难的不是代码,而是 字段映射类型(JSON 里的字符串和 Doris 的 Date/Double 对齐)。星主会提供《字段映射避坑清单》。

🟡 第二关:数据建模

目标:把数据“洗”干净 · 2-3周
此阶段 SQL 占比飙升至 95%! 所有操作均为 INSERT INTO ... SELECT ...
任务拆解核心 SQL 技巧编排动作
ODS → DWS • 每日用户汇总宽表(每用户每日一条)
• 事件明细汇总(每用户每日每事件)
• 道具流转(每用户每日每道具)
GROUP BYCASE WHEN 打标、
ROW_NUMBER() 去重
写入 DolphinScheduler(或 Airflow)定时任务,每日凌晨2点跑批
ODS → ADS • 留存位图表(秒级查留存)
• 累计快照表(截止当前的在线总时长 / 付费总额)
Doris Bitmap 函数bitmap_union
窗口函数 SUM() OVER(ROWS UNBOUNDED PRECEDING)
任务之间配置 依赖关系(DWS 跑完才能跑 ADS)
质量监控 数据量同比/环比波动检测(比如昨天突然少了20%要告警) COUNT(*) + 昨日数据 LAG 对比 Python 脚本拉取数据发钉钉/企微
💡 星主经验:百亿级数据严禁多表 JOIN。宽表冗余 是所有性能的基石。一张用户宽表包含所有属性(活跃、付费、设备),后续查询 只查这一张表

🔵 第三关:可视化和服务

目标:把数据“用”起来 · 1周
让业务方看到炫酷看板,让后端调取数据接口。
你的动作技术选型SQL 占比关键产出
搭建看板 Metabase 连接 Doris,写 Native Query(原生 SQL)
制作:实时大盘、留存曲线、用户画像
80%(复杂的子查询 + 变量传参) 运营/老板可直接筛选日期查看
数据服务 API FastAPI 写 3 个接口(查昨日汇总、查实时在线、查留存) 10% 业务后端直接调用,无需重复查数仓
权限管理 Metabase 分组权限(老板看大盘,运营看明细) 0% 数据安全隔离

🟣 第四关:AI + 数仓

目标:降维打击分析效率 · 持续迭代
星球独家彩蛋 — 让大模型帮你读数据、写报告、找异常。
场景实现方式价值
自动日报生成 每日早8点,Python 调用 Doris 查出关键指标(DAU、收入、时长),喂给大模型 API,输出 200字运营建议文本 节省分析师每天早上1小时写日报时间
异常归因 检测到 DAU 突降,自动查询 DWS 表对比各渠道、各版本数据,AI 总结 “iOS端v3.2版本崩溃率上升导致” 从 “发现异常” 到 “定位原因” 缩短至 1 分钟
自然语言取数(进阶) 搭建 Text2SQL(基于开源项目如 Vanna),让运营直接问 “上周付费最高的省份是哪” 彻底解放数据人力
🎁 四、星球四大权益与关卡对应表

让你的付费物超所值,将四大权益直接嵌入闯关过程:

独家全流程教程干货

全部关卡 · 提供《百亿级Doris分桶策略》《Routine Load全参数解析》《Metabase高级参数化图表》等 PDF + 视频拆解

学习问题解答

全部关卡 · 遇到 null 值处理、Bitmap结果不对、OOM报错,星主24h内必回(附带生产环境排错思路)

项目实践流程指导

第二关(编排) · 提供 完整的 DolphinScheduler 工作流定义 JSON,导入即可用,包含失败重试、补数策略

AI + 数仓能力建设

第四关 · 开源 星球自用 AI 日报 SKILL 源码,填入你的 API Key 即可上线

🧘 五、给新人的定心丸

「一人数仓」社群 · 让每个数据人成为全栈数仓工程师