在开始之前,请彻底忘掉传统大数据团队的“高门槛”:
新同学最容易犯的错是“什么都想学”。请严格按你的当前身份选择 主攻路径:
每关都标注了 “SQL 占比” 和 “编排动作”,让你清晰感知自己的成长。
| 你的动作 | 技术选型 | SQL 占比 | 关键产出 |
|---|---|---|---|
| 采集(2选1) | ① FastAPI 写1个Http接口(复制星主模板) ② Filebeat 直接监听日志文件(零代码推荐) |
0% | 数据进入 Kafka |
| 入仓(核心) | 配置 Doris Routine Load,把 Kafka JSON 映射到 ODS 表 | 10%(只需建表SQL) | 数据实时入库,延迟 ≤ 10秒 |
| 成本控制 | Doris 表设置 动态分区 + 冷热分离(SSD存3天,HDD存历史) | 10% | 存储成本直降 70% |
| 编排动作 | 写一个 Shell 脚本 + Crontab,每小时检查 Kafka Lag 积压数 | — | 积压告警基础 |
INSERT INTO ... SELECT ...。| 层 | 任务拆解 | 核心 SQL 技巧 | 编排动作 |
|---|---|---|---|
| ODS → DWS | • 每日用户汇总宽表(每用户每日一条) • 事件明细汇总(每用户每日每事件) • 道具流转(每用户每日每道具) |
GROUP BY、CASE WHEN 打标、ROW_NUMBER() 去重 |
写入 DolphinScheduler(或 Airflow)定时任务,每日凌晨2点跑批 |
| ODS → ADS | • 留存位图表(秒级查留存) • 累计快照表(截止当前的在线总时长 / 付费总额) |
Doris Bitmap 函数(bitmap_union)窗口函数 SUM() OVER(ROWS UNBOUNDED PRECEDING) |
任务之间配置 依赖关系(DWS 跑完才能跑 ADS) |
| 质量监控 | 数据量同比/环比波动检测(比如昨天突然少了20%要告警) | COUNT(*) + 昨日数据 LAG 对比 |
Python 脚本拉取数据发钉钉/企微 |
| 你的动作 | 技术选型 | SQL 占比 | 关键产出 |
|---|---|---|---|
| 搭建看板 | Metabase 连接 Doris,写 Native Query(原生 SQL) 制作:实时大盘、留存曲线、用户画像 |
80%(复杂的子查询 + 变量传参) | 运营/老板可直接筛选日期查看 |
| 数据服务 API | FastAPI 写 3 个接口(查昨日汇总、查实时在线、查留存) | 10% | 业务后端直接调用,无需重复查数仓 |
| 权限管理 | Metabase 分组权限(老板看大盘,运营看明细) | 0% | 数据安全隔离 |
| 场景 | 实现方式 | 价值 |
|---|---|---|
| 自动日报生成 | 每日早8点,Python 调用 Doris 查出关键指标(DAU、收入、时长),喂给大模型 API,输出 200字运营建议文本 | 节省分析师每天早上1小时写日报时间 |
| 异常归因 | 检测到 DAU 突降,自动查询 DWS 表对比各渠道、各版本数据,AI 总结 “iOS端v3.2版本崩溃率上升导致” | 从 “发现异常” 到 “定位原因” 缩短至 1 分钟 |
| 自然语言取数(进阶) | 搭建 Text2SQL(基于开源项目如 Vanna),让运营直接问 “上周付费最高的省份是哪” | 彻底解放数据人力 |
让你的付费物超所值,将四大权益直接嵌入闯关过程:
全部关卡 · 提供《百亿级Doris分桶策略》《Routine Load全参数解析》《Metabase高级参数化图表》等 PDF + 视频拆解
全部关卡 · 遇到 null 值处理、Bitmap结果不对、OOM报错,星主24h内必回(附带生产环境排错思路)
第二关(编排) · 提供 完整的 DolphinScheduler 工作流定义 JSON,导入即可用,包含失败重试、补数策略
第四关 · 开源 星球自用 AI 日报 SKILL 源码,填入你的 API Key 即可上线
「一人数仓」社群 · 让每个数据人成为全栈数仓工程师