如果你只有一堆人的电话号码,这可能没多大意义。但像携程的数据,比如所有人提前预订、搜索、浏览、点评的信息等,这就是有价值的。但更深层的核心是,你能不能在某个产品上使用到这些数据,而且确实有帮助。首先要弄清楚拥有的数据是否有价值,是否有人愿意为其买单。另外则是源数据的丰富度,是否能够为数据价值的发挥带来补充和完善。
显然,数据收集的目的并不单单是把数据集中起来,最终还是要在实际运营中发挥作用。拥有数据只是开端,如何深入分析、洞察数据彼此之间的关联,才是大数据应用的关键,这也是众多手握大数据企业的分水岭。不过,在这个过程中,有一个不容忽视的问题,那就是数据的质量问题。错误的输入,换来的必然是错误的输出。
真正决定数据挖掘成败的是数据本身的质量,对于算法的合理使用和优化反而是次要的。由于大数据的兴起,我们很容易获得庞杂的数据;然而单纯地指望从高深的算法中去获得我们想要的信息而忽视数据本身的质量,往往只能是空中楼阁。
对大数据而言,表面上看数据是越多越好,因为更多的数据可以产生更能拟合真实情况的场景,但同时更多的数据也产生了更多的噪音——所以单纯的数据的量的增加并不能提高计算的精准度。
焦宇从自己的实践经验出发,谈了自己的看法:“对一个特别好的产品经理来讲,大数据的门槛首先是要理解这个东西到底是什么;第二建模能力要强。从这两方面说,人才相对都是稀缺的。比如有些公司是有大数据的,但要找到很牛的人来做这件事情,虽然理论上讲是可以随时找到的,但事实上却很难。”
“第一个是大数据。第二个方面,有人把数据比喻成‘石油’,有石油宝藏还得有机器、工具把它挖出来,这个工具就是机器学习。第三方面是计算能力的进步。工具再强,没有非常强的计算能力,还是跑不动的。”滴滴研究院院长何晓飞则给出了这样的答案。
数据挖掘,不像收集数据填几张表,问几个问题就能轻松实现。它的专业性相对较高,运用的知识、技术难度也明显加大。因而大多数的数据挖掘基本是由专业人士或专业团队来做的。
另外,建模的成功与否,对数据呈现的结果也有非常重要的影响。模型不同,结果也往往会出现差异。
“任何人都能搭出来一个模型,只要搭出模型就能有结果,但这个结果是不是反映真实世界?因为数据之间的关系,并不是直接的线性关系,因此模型可以非常复杂。所以你先得知道你要解决的是个什么问题:从统计上来讲,是哪种类型的问题,它有什么样的特性,你在数据上的采集有什么局限?然后再找到跟这个问题最接近的模型。”焦宇说。
“数据挖掘的难点在于,主要数据收集和最终应用之间的相互关联却又矛盾的关系,这类似于‘先有鸡还是先有蛋’的问题。两者之间相互影响相互补充,导致其相对其他类别的程序开发而言,是更为漫长而又复杂的过程。” 韩鑫说道。
无论是焦宇所说的模型,还是韩鑫所说的算法,其实都在强调一个重点:根据实际情况变化对模型和算法做出相应的调整。没有固定的规则,只有时时更新的数据和不断变化的情况,所以运用的规则也要因时调整。
"对一个具体区域来说,滴滴数据大脑已经达到提前15分钟实现超过88%准确率的预测。根据预测结果,就可以选择要不要对司机运力进行调度,使在附近的司机可以提前到达运力紧缺的区域,以缓解可能发生的拥堵。对于出行领域而言,预测的是未来的交通情况,以帮助智能调度。”滴滴研究院院长何晓飞曾这样对外表示。
这是一个正面案例。反过来看,如果大数据无法为企业营销、决策、运营找到合适的解决方案,那它的应用前景自然不会被企业看好。所以大数据到底“准不准”,从最初就是商业力量最关注的点。
比如在《黄金时代》上映前,百度就对其票房做过预测,认为这部电影十一黄金周的票房会在2——3亿元之间,当时也有不少媒体都认为百度的预测过于保守。实际情况出来后却让人大跌眼镜,上映半个月票房还没过5000万。
作为互联网公司的排头兵,百度拥有的数据量其他企业自然是难以匹敌的,但出现这种结果,却不能不令人深思。
“大数据归根结底还是历史数据,是否能用于预测未来,既要看具体的问题,也要看从历史数据中分析出来的规律是否能在未来重演。仔细分析问题,梳理规律适用的条件,充分理解数据、理解技术的局限,做到正确的使用大数据的成果,才能有对现实起到真正的作用。”韩鑫说道。
从另一个角度来看,大数据预测的基础还是需要一定量的数据。但究竟多大的数据量才算是大数据?这个问题业内并没有一个统一的划分标准。而中小企业也掌握一定量的数据,那么与BAT相比它的优势又在哪?
阿里研究院高级专家程欣指出:“中小企业的大数据主要是会员数据和订单数据,用途是crm和定价分析,但无法分析不是自己的用户。”每一类企业都有自己的短板,最明智的做法不是去一味的补齐短板,而是要充分发挥自己的优势。
美团云大数据平台负责人认为:“用大数据是希望能够有更全面的信息帮助企业决策,而不是为了用大数据而用大数据。应该反过来看,企业的数据内容,是否能够为某个行业的深度应用带来补充。所以中小企业的数据,这里我不想提‘大’这个字,有点过于强调概念了,关键是看内容层面是否有垂直化的信息补充,采集到BAT所没有的数据。”
数据挖掘技术的诸多门槛,以及建立数据挖掘部门所需的投入,也决定了并非所有的企业都能拥有数据挖掘能力。数据挖掘能力要与公司规模与发展阶段相匹配,在产品并不成熟的情况下,从现有人员中根据业务需要兼职去做会是一个不错的开始,并不一定需要配备独立专职的团队。在业务逐步走向成熟阶段,再逐步建立专业化的数据团队,则是一个更现实办法。
不过韩鑫坦言,大数据就像是好的武器,到底能否有效、规模化的在各个战场取胜,在于如何分析战场形势,合理的使用武器达到战术目的,形成战略性胜果。
来源网络
文章版权归广州市西美信息科技有限公司(Kcomber Inc.)所有,欢迎各媒体及企业与我们联系并转发。如果需转载,请注明来源.
Kcomber Inc.
广州市西美信息科技有限公司(Kcomber Inc.)始创于2001年,总部位于广州,是国际领先的专业化知识管理及平台服务企业,一直致力于为客户提供企业发展综合解决方案,帮助企业做出正确的决策,以适应市场的变迁。目前企业旗下拥有CCM, KCOMDATA, TRANALYSIS,ValoTracer等七个子品牌.


