大概从去年下半年开始,我平时要分析的数据量,成倍、成千倍、成万倍地往上翻。翻到某个点上,我原来那套分析能力,就再也撑不起这么庞大的数据了。我像是一下子陷进了海量数据的漩涡里。
数据涨到几千万条,既往的分析流程不能使用
最一开始数据量其实没那么夸张,只有几万条。这个量级我靠 Excel 自带的数据透视表就够用了,整理、分析,把数据里的问题揪出来,甚至能挑出某一段异常的时间段,一行一行去看,到底异常在哪。后来数据到了几十万条,我也还能应付,把数据整理、拆分,再借助之前在小数据集上跑通的脚本来定位问题。这个阶段,脚本分析得对不对,我自己还能验证。
真正卡住我的是几千万条的数据量级。首先,Excel根本打不开这么大的数据,勉强打开也卡死,稍不留神就崩。其次,这么多数据、这么多要分析的维度,我拿当时的 AI(御三家)去跑,每家给出来的结果还都不一样,而我又没办法自己算一遍,去确认到底哪份是对的。
后来我想了个笨办法把这一关过去了:先把所有分析维度,在几百万条的数据集上跑通,让 AI 出一份脚本;然后我在 Excel 里把这个数据集的正确结果拉出来,拿这两份一一对照,确认 AI 到底对不对。等把它调到完全没问题,我再拿这份脚本去跑几千万条的全量数据,正确性就有了保证。此后很长一段时间,我都是靠这个办法扛住了数据量激增的压力。当中的关键是:我给 AI 的产出,找到了一把自己能验证的方法。
0
评论 (0)