第一部分:Minerva 简介——一个面向大规模数据分析的指标平台
作者:某海外数据平台团队
发布时间:2021 年 5 月 1 日
图片说明:数据是用户声音在大规模场景下的体现。新冠疫情期间,我们通过数据看到,旅行需求已经明显转向本地化。
引言:为什么大规模业务需要指标一致性
在某海外住宿平台,数据决策贯穿业务始终。通过随机对照实验测试产品创意,并持续严谨追踪业务表现,全力为用户创造最大价值。为此,我们需要构建强大数据平台,覆盖从数据采集、建模到决策支持的完整环节。
指标统一是数据驱动组织的分析基石。若不同团队对同一问题得出各异结论,决策者便无从判断数据的权威性。Minerva应运而生,正是为解决这类问题而构建的指标平台。
此前,我们曾介绍数据导入数据仓库及用户自助分析的操作方法,但未系统阐述数据建模与转换的关键环节——如何将原始数据加工为准确、可信且可分析的数据集。
本文将回顾Minerva的建设历程。作为公司内部的数据指标平台,它已成为分析、报告和实验的单一可信数据源。我们将阐述构建Minerva的初衷,解析其核心功能及配套工具生态,并重点说明其对公司的实际影响。后续文章会进一步拆解Minerva的技术实现细节,并分享经验与教训。
希望借助这一系列内容,让读者理解Minerva这类系统的价值,从中汲取灵感,构建适合自身组织的数据指标平台。
数据分析体系的早期发展
起步阶段与许多数据驱动公司类似,我们的数据业务始于2010年。当时公司仅有一名全职分析师,其笔记本电脑就是"数据仓库"。查询常直接在生产数据库执行,偶发的超负载查询甚至导致线上服务中断。
尽管存在明显不足,这套简易方案在随后几年里仍助公司发掘诸多增长机会。2010年代初期,业务规模持续扩张,公司陆续聘用更多数据科学家,数据体量与类型同步增长。这一阶段开启了第一轮数据基础设施升级:替换原有调度系统为开源工具Airflow,并投入资源打造核心数据表"core_data"。
图片说明:公司业务规模与数据量在多年间实现跨越式增长。
依托core_data,公司分析能力迅速提升。在搭建扩展实验平台引入A/B测试文化后,又开发了内部数据目录Dataportal,并开源了可视化分析工具Superset,赋能更多用户独立分析数据。此外,公司还推出"数据大学"培训项目,为非数据背景员工普及实用技能。
指标体系成长中的问题
core_data显著提升数据能力的同时,也带来了新的挑战。数据与使用场景的激增,让数据生产者与消费者均感到压力。
首先,core_data普及后,越来越多数据生产者希望将其用于分析、预测和实验。几乎每天都有人基于core_data表尝试构建新数据集。这种状况导致数据口径分散,不同团队对同一问题可能给出不同答案。若非统一标准,数据便失去可信度基础。









网友评论