广 告
科技长廊 >>  科技动态>> 综述:大数据分析面临的机遇与挑战
[专题]科技文章

综述:大数据分析面临的机遇与挑战
作者:转载    转贴自:科技长廊    点击数:59    文章录入: zhaizl

800个(红色)和6400个(蓝色)独立的标准正态分布中,第1个与其余4个变量的最大相关系数的统计分布(n=60)。观察可知,假相关系数相当大。

大数据分析给现代社会带来了新的机遇与挑战。一方面,与传统研究侧重于揭示事物的共性不同,大数据研究将有助于人们发现事物的个体特性,并针对每一个体的特性给出个体化的解决方案。同时,大数据研究也将使人们能够从大量个体的差异变化中,揭示其中存在的难以察觉的规律。另一方面,大数据的海量样本规模和高维数特征也引入以下显著特性:数据搜集的偏差性、数据产生的异母体性、计算成本、噪音的累积叠加、假关联性、外生性,以及测量误差等等。为了应对这些挑战,需要引入新的计算和统计方法。

由美国普林斯顿大学范剑青教授作为通讯作者撰写、发表于《国家科学评论》的综述文章“大数据分析面临的机遇与挑战”(http://nsr.oxfordjournals.org/content/1/2/293.full)阐述了大数据独有的特点及其对统计分析和计算体系结构的影响。

首先,从计算的角度来看,大数据提供的数据量巨大,这会给实施统计计算和最后完成统计估算和检验带来问题。比如,对于一个列数上百万的矩阵,一次简单的矩阵求逆操作在计算上都是困难的。该文概括性地介绍了Hadoop分布式文件系统、MapReduce编程模型、云计算、凸优化算法,以及随机投影技术,以解决海量数据的计算问题。其次,从统计分析的角度来看,大数据经常包含被抽样个体的大量特征信息,即样本的个异性和高维性。个异性和高维性给统计分析与计算带来诸多问题,包括异母体、噪音累积、假相关、内生性。以假相关性为例,高维数会增加发现欺骗性关联的风险。比如,在人类基因表达数据分析中,学者可能会认为第八对染色体上的某个重要致癌基因(MYC)和Y染色体性别决定基因(SRY)有很强的相关性。但是,这可能仅仅是因为考虑的基因数目太高,以至于有些高相关性的出现只是偶然事件。

该文也为大数据分析提供了新的展望。以高维数据下的统计推断为例,文中给出了高致信区间内的最稀疏解的一般解,并指出许多传统的理论所基于的外生性假设是不正确的,尤其可能导致错误的统计推断,并得出错误的科学结论。以内生性问题为例,范剑青教授和他的合作者指出,线性回归模型中的外生性假设在高维数下很可能是不正确的:当考虑的回归变量数目很大时,其中的一些回归量(自变量)很有可能和模型的误差项相关。他们发现,当内生性问题存在时,流行的高维回归方法(诸如lasso和SCAD)的估计值不具有相合性,即:随着样本数变大,估计量和母群体参数的差异不会趋近于零。本文介绍了一种新的、基于广义矩与高维回归的方法。这个方法可以克服内生性问题,并给出具有一致性的估计量。

  • 上一篇文章: 施一公课题组发表论文 研究肠道病原微生物抗酸

  • 下一篇文章: 科学家成功捕获“消失”的富勒烯
  •   最新5篇热点文章
      最新5篇推荐文章
      相关文章
    ·给ueditor编辑器赋值[306]
    ·首届北京生命科学论坛成功举办[619]
    ·基因揭示企鹅如何应对气候变化[619]
    ·第一性原理计算中电子关联效应…[619]
    ·看iPhone72变真正魅力 只要安装…[620]
    ·C# Request.ServerVariables2[698]
    ·Request.ServerVariables[701]
    ·浅析C# List实现原理[703]
    ·Request.ServerVariables 获取…[704]
    ·浅析C# List实现原理[704]
    ·太空梯被指稳定性差 上天过程耗时费力[4341]
     
    网友评论:(只显示最新10条。评论内容只代表网友观点,与本站立场无关!)