前言:整个系列的最后一环

这是我们“大数据的思维方式”系列的第六篇,也是终章。

前面五篇文章,我们追踪了数据的一生:它怎么被定义、怎么被采集、怎么被存储、怎么被计算、怎么被展示。

现在,我们来到了最后一步。

数据被采集、存储、计算、展示之后,最终要回答一个问题:它怎么用?

如果前面的所有环节是“把小麦从地里收回来、磨成面粉、烤成面包、摆在货架上”,那使用,就是有人把这个面包吃下去,转化成能量,去做了点什么

没有这一步,前面的一切都是白费。

数据的“使用”,从宏观到微观,可以分成两个截然不同的方向:

一个向上,服务决策者——帮老板、帮政府、帮管理者做更明智的决策。这叫“上层决策”。

一个向下,服务每一个用户——在你刷视频、购物、出行的时候,让机器自动给你最合适的推荐、最及时的提醒。这叫“机器学习反馈用户”。

一个是“让人更聪明地管”,一个是“让机器更懂你地服务”。今天这篇文章,我们就来把这两条线都讲透。

一、向上:数据怎么帮管理者做决策?

我们先从一个你每天都在用、但可能没意识到的东西说起。

1.1 你开车时,手机地图是怎么告诉你“该换路了”?

你在高架上开着车,导航突然弹出一句话:“前方3公里发生事故,预计拥堵15分钟,已为您切换路线,节省约12分钟。”

你没做任何操作。你只是开着导航,它就自己替你做了一个决定。这个建议从哪里来?

它的逻辑链条是这样的:

  • 采集:前方路段上几百辆车的GPS数据,被实时采集上来。

  • 计算:系统发现这几百辆车的平均移动速度从60码骤降到了5码——这不正常,大概率有事故或施工。

  • 判断:系统计算出“此路段通过时间将比正常多15分钟”。

  • 决策:系统自动搜索附近的其他路线,计算每条路线的预计时间,选了一条最快的。

  • 推给你:“请换路。”

这一个过程,人工没有参与一秒钟。从数据采集到行动建议,全部自动完成。

这就是大数据使用的第一种形态:用数据做决策,而且是用数据做“机器的自动决策”。

1.2 从数据到决策,中间隔着什么?

导航的故事听起来很自然,但你想过没有:从“几百辆车在减速”到“建议你换路”,中间其实隔着一个非常重要的步骤?

这个步骤,叫洞察的形成

原始数据本身是不能直接用来决策的。一堆GPS坐标点,能直接告诉你“该换路”吗?不能。

它需要被加工成人能理解的洞察:

第一步:监测异常。 “这条路现在的通行速度,比正常时段低了80%。”
第二步:推断原因。 “大概率是发生了事故或施工。”
第三步:预测影响。 “按这个速度,你到目的地会晚15分钟。”
第四步:给出方案。 “换这条路,能省12分钟。”

这个“监测→推断→预测→方案”的四步走,就是数据驱动决策的标准流程。

不只是导航,所有用数据来辅助决策的场景——从企业高管看报表,到政府制定政策——背后都在走这个流程。

1.3 老板的决策,和导航是一个道理

你是一个连锁超市的采购经理。明天要下单进货了。进多少?进多了卖不掉烂在仓库里,进少了不够卖被顾客骂。

以前你怎么决定?凭经验。你在这一行干了十年,你大概知道这个季节、这种天气、这个星期几,什么东西好卖。但这叫“拍脑袋”,准不准全看你个人状态。

现在呢?公司的数据分析系统,每天早上给你推一张“智能备货建议单”:

  • 包子:明天预估需求420个(上周五卖了385个,但明天降温5度,历史数据显示降温天包子多卖9%)

  • 豆浆:明天预估需求310杯(比平时少5%,因为明天是周六,上班族少了)

  • 暖宝宝:明天建议备货200个(降温信号触发,建议陈列到门口货架)

这里面每一个数字,都不是人拍出来的,是数据算出来的。系统在做的事,和导航一模一样:

  • 监测:历史同期销量、近期趋势、天气变化。

  • 推断:降温天包子会多卖,周六上班族少豆浆会少卖。

  • 预测:给出每个品类的预估销量。

  • 方案:直接生成一张你可以照着下单的建议单。

数据帮管理者做的,就是把“我感觉”变成“数据说”。把决策从依赖个人经验的“拍脑袋”,变成依赖历史规律和实时信号的“看数据”。

1.4 但数据不能替你做所有决定

听到这里,你可能会有一个疑问:既然数据这么厉害,那是不是以后所有决策都交给它就行了?老板可以下岗了?

不是。这里有一个非常重要的边界。

数据能告诉你“明天大概会下雨”——这是概率,是预测。但数据不能替你决定“下雨天要不要出门”——这是选择,是你的价值判断。

数据能告诉你“这条路最近,但这条路最堵”——这是事实。但数据不能替你决定“你是要快,还是要省油”——这是偏好。

数据能告诉你“历史上降温天包子多卖9%”——这是规律。但如果你昨天刚在隔壁开了一家新店,这个历史规律还靠不靠谱?需要你自己来判断。

数据擅长回答“是什么”和“可能会怎样”。但“我应该怎样”,最终还是人自己的决定。

数据是辅助,不是替代。它帮你把“猜”的部分缩小,但“选择”的权利,永远在你自己手里。

二、向下:数据怎么让机器“更懂你”?

好,上面那条线我们讲完了——数据怎么往上走,帮管理者做决策。

现在,我们来讲另一条线,也是你每天都在体验、但可能没有细想过的一条线:数据怎么往下走,让机器自动给你个性化的服务?

2.1 从给你的年度报告说起

每年年底,你打开音乐APP,看到一份精美的年度报告:“你一年听了3847首歌,总时长216小时,最爱周杰伦。”

这个报告,我们前面在计算篇和展示篇里提到过多次。它背后的数据加工流程你现在应该很清楚了:一年攒下几万亿条听歌记录 → 分布式计算按用户分组统计 → 展示层翻译成好看的H5页面。

这是一次“向上”的使用——数据被汇总、分析,以报表的形式呈现给你。让你了解自己。

但数据的使用不止于此。还有另一种更聪明的方式。

2.2 比年度报告更懂你的,是每天给你的推荐

假设你的年度报告显示:你今年听了347次周杰伦,你是他铁粉,你的听歌高峰在晚上10点到凌晨1点。

好,现在系统知道了这些。

但然后呢?系统不会只是把这份报告放在那里好看。它会拿这些数据去学习,去训练一个模型,让这个模型能回答一个问题:“在晚上十点,给这个人推什么歌,他最可能不切掉?”

这个“学习”的过程,大概是这样:

系统把你过去一年的听歌记录拿出来——哪首歌你听完了,哪首你听了5秒就切了,哪个歌手你一听就收藏,哪个类型你从来不看。

然后,它用一种叫机器学习的方法,从这些历史数据里“学”出一套规律:

  • 这个人,周杰伦的歌基本不切。

  • 这个人,说唱类基本秒切。

  • 这个人,晚上十点以后偏爱慢歌,白天听快歌多。

  • 这个人,对刚上新的歌更好奇,会点进去试听。

这些规律,不是人一条一条写出来的规则。是机器自己从海量数据里“扒”出来的。

有了这套规律之后,当你今天晚上十点再次打开APP,系统就开始工作了:

  • 它从几千万首歌里,筛出一个候选池——“晚上十点”“慢歌”“接近周杰伦风格”“最近上新”。

  • 它给每一首歌打一个分——“这个人听完不切的概率有多高?”

  • 它把得分最高的那一首,放在你首页第一个位置。

  • 你点进去了,听完了,点了个赞。这条新数据,又会被采集回去,继续“喂”给模型,让它下次推得更准。

这就是机器学习反馈用户的完整闭环:

你的历史行为 → 训练模型 → 模型学习你的偏好 → 给你个性化推荐 → 你产生新行为 → 新行为继续训练模型。

你用得越多,它越懂你。你说“这APP真懂我”——没错,它是用你过去每一次的行为数据,一点一点“学”出来的。

2.3 换一个角度看:你的“数字替身”在为你打工

讲到这里,你可能觉得有点复杂。我换个角度帮你想。

你有没有发现,推荐系统在帮你做一件事:替你筛选信息。

这个世界上有上亿首歌、上千万个视频、几百万件商品。你一个人,一天只有24小时,你根本看不过来。如果没有筛选,你打开任何一个APP,面对的都是汪洋大海,你根本不知道从哪儿开始。

推荐系统做的事情,就是用你过去的行为数据,给你造了一个数字替身。这个替身了解你的喜好,知道你的习惯。然后它24小时不睡觉,在这上亿个选项里帮你挑——哪些是你大概会喜欢的,哪些是你大概会讨厌的。你打开APP时看到的,不是全部,而是它替你筛过一遍的精选集。

所以,换一个角度看,不是“机器在利用你的数据”,而是你的数据身份在为你打工。它替你排队、替你过滤、替你记住你的偏好。它不会累,不会忘,而且越干越熟练。

当然,这个替身也有局限——它只能根据你“过去”的行为来猜你“现在”想要什么。如果你今天突然想换个口味,它可能反应不过来。但总体来说,它确实帮你省了大量时间。

2.4 机器学习,本质上在做三件事

好,现在你理解了推荐系统的工作方式。但机器学习不止是用来推歌、推视频、推商品。它在数据的“使用”这个环节,主要承担了三种角色。

第一件事:分类——判断你属于哪一类。

你申请一张信用卡。银行的风控系统,要在几秒内决定:批还是不批,额度给多少。

它怎么决定?它把你的个人信息、消费记录、征信报告扔进一个模型。这个模型是从几百万个历史用户的还款记录里“学”出来的。它知道:收入稳定、消费规律、征信无不良记录的用户,大概率会按时还款。

然后它把你“分类”到了“低风险”这个类别里,通过了你的申请。

整个过程没有人工审批。数据训练出来的模型,在替你做出这个决定。

第二件事:预测——猜你接下来会做什么。

你打开购物APP,首页第一个位置是一件冲锋衣。你没有搜过冲锋衣,但你这周查了“四姑娘山天气”,在社交平台看了一篇“新手徒步装备清单”,昨天还在地图上搜了“四姑娘山景区路线”。

这些行为散落在不同的地方,但系统把它们关联在一起之后,形成了一个非常强的信号:这个人要去高海拔地区徒步。

冲锋衣、登山鞋、登山杖——这些是“去高海拔徒步”的人大概率会买的东西。预测模型把这个结果推到了你面前。

它做的不是“看到了你的搜索记录所以推广告”——它做的是“从你散落各处的行为里,推断出你的意图,然后提前把东西准备好”。

第三件事:创造——生成你从没听过的新内容。

最近两年你听到的“AI写文章”“AI画图”“AI写歌”,本质上也是机器学习在“使用”数据。只不过它用的不是你的个人行为数据,而是人类历史上积累下来的海量文本、图片、音频数据。

模型从这些数据里学到“什么是好的文章结构”“什么样的画是美的”“什么样的旋律是和谐的”,然后当你给它一个指令时,它就能生成对应的内容。这是数据使用最前沿的形态——不只是分析已有的数据,而是用数据“创造”新的东西。

三、两种使用方式,一个是向后看,一个是向前看

好,我们讲完了上层决策,也讲完了机器学习反馈用户。

现在你回过头来看,这两种使用方式,表面上一个向上、一个向下,但它们还有一个更深层的区别:面对时间的方向不一样。

上层决策,大部分是向后看——从已经发生过的事情里找规律,用来指导还没发生的事。

昨天的销售数据,指导明天的备货量。过去一年的流量规律,指导明年的预算分配。上一季度的用户投诉分布,指导下一季度的服务改进。

这叫“后见之明”转化为“先见之明”。先总结过去,再规划未来。

机器学习反馈用户,大部分是向前看——在事情还没发生的时候,就提前预测你会做什么。

你还没搜“冲锋衣”,它已经把冲锋衣推到你面前了。你还没点开那首歌,它已经知道你会听完。你还没输入完整的问题,搜索引擎已经猜到你想问什么。

这叫“先发制人”。预测未来,提前行动。

但不管是向后看还是向前看,它们遵守的是同一个逻辑:用过去的规律,对抗未来的不确定性。 数据是燃料,计算是引擎,洞察是动力,行动是终点。没有数据,决策靠猜。有了数据,决策靠算。算得越多,猜得越少。

四、使用,并不是数据的终点

讲到这里,你可能会觉得:采集→存储→计算→展示→使用,数据的一生走完了。

但其实,使用并不是数据的终点。

你听了系统推荐的歌,点了个赞——这条新数据,又会被采集回去,存进仓库,被计算,被展示,成为下一次推荐的依据。

你看了报表,决定明天多备50斤包子——明天多备50斤这个“动作”,又会被系统记录为一条新的库存数据,进入下一轮的分析循环。

你换了导航推荐的路线,按时到达目的地——这次换路的结果,又会被系统用来优化未来的路线推荐算法。

所以你看,数据的生命不是一个线段,从采集到使用就结束了。它是一个环,一直在转:

采集 → 存储 → 计算 → 展示 → 使用 → 新的采集 → 新的存储 → 新的计算 → ……

每一次使用,都在产生新的数据。新的数据,又会驱动下一次使用。

这正是大数据系统最迷人的地方:它是一个“活的”系统,每一秒都在自我更新。 它不是建好之后就一成不变的机器,而是一条一直在流动、一直在进化的河流。你此刻产生的数据,可能就是下一秒别人决策的依据。

五、便利的代价:一个需要你自己回答的问题

在结束这个系列之前,我还想跟你聊一个绕不开的话题。

我们前面讲了数据带来的那么多便利——更准的导航、更懂你的推荐、更聪明的决策。这些便利是真实的,但便利不是免费的。

每一次精准的推荐,背后都意味着系统对你的了解又深了一层。每一次个性化的服务,背后都意味着你的行为又被记录了一次。

这不是什么阴谋论,这就是便利的运行成本。

你愿意用多大程度的个人信息,去换取多大程度的便利?这个边界没有标准答案,也不可能由我、由任何一家公司、由任何一条法律替你划好。这个边界,只能由你自己来决定。

你可以在手机设置里关掉某些权限,可以拒绝非必要的用户画像,可以用脚投票选择那些更尊重你隐私的产品。当然,你也可以选择什么都不做,享受这份便利。

不管你怎么选,我希望你至少知道:这个选择权在你手里。 你看懂了数据是怎么用的,你就知道哪些是你可以交出去的,哪些是你可以守住的。

六、整个系列的收尾:你,现在是一个“会看数据的人”了

我们的系列到这里,就走完了数据完整的一生。

定义:数据是什么?不是你原来以为的“表格里的数字”,而是你每天每一个动作、每一次感受、每一次与世界的交互,在数字世界里投下的影子。

采集:这些影子是怎么被捕捉的?主动的你填的表,被动的你滑的屏。各式各样的传感器布满了你的生活。它们安静地工作着,把你的行为变成了数据流。

存储:捕捉到的数据住哪儿?表格数据住公寓,日志数据住Loft,照片视频住大仓库。当数据大到一栋楼住不下,人们发明了“分布式”——把数据分块存、多存几份、用花名册统一管理。

计算:存起来的数据怎么变成有价值的信息?靠计算。从人脑心算到Excel到数据库到分而治之的分布式计算。离线计算攒一波统一算,实时计算来一条算一条。计算在做的,就是把价值密度低的矿石,提炼成纯度高的黄金。

展示:提炼出来的信息怎么让人看见?靠翻译和关联。把机器语言翻译成人类语言,把孤立的数据关联成信息网,最后利用人脑天生对图像敏感的特点,把信息画成图,让数据自己“说话”。

使用:看见之后怎么用?向上,帮管理者做更聪明的决策,让“我感觉”变成“数据说”。向下,让机器学习你的偏好,在你需要的时候给你最合适的服务。不管是向上还是向下,本质都是用过去的规律,指导未来的行动。


这六篇文章的顺序——定义、采集、存储、计算、展示、使用——不是我设计的教学大纲,这是数据本身的生命历程。你理解了这条生命线,你就理解了这个数字世界是怎么运转的。


我在开篇第一篇文章里,写过这样一段话:

大数据和你我之间,是一种双向但不对等的关系。平台用你的数据来赚钱,效率比你用数据来薅羊毛高得多。但不对等,不意味着你只能躺平。你可以选择看懂它,了解数据是怎么采集的、怎么存储的、怎么计算的、怎么影响你的——然后在力所能及的范围内,保护自己该保护的,利用自己能利用的。

现在,六篇文章看完,你应该不再是那个“被数据看”的人了。

你已经知道,你每一次点击、每一次滑动、每一次停留,是怎么被采集、存储、计算、展示,最终反作用于你的。

你不是数据海洋里的一粒沙。

你是能看懂洋流方向的人。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐