当前位置:大数据业界动态 → 正文

美媒:大数据兴起 数据科学家成热门职业

责任编辑:editor006 |来源:企业网D1Net  2014-08-11 14:31:26 本文摘自:参考消息

参考消息网8月11日报道 美国《华尔街日报》网站8月9日报道称,克里斯·法雷尔现年28岁,是一名数据科学家。这个工作头衔3年前还不存在,但从那时以来却成为高科技劳动市场上最热门的角落之一。零售商、银行、重型设备制造厂和婚介所都想让专家从互联网、机器和智能手机上提取并分析大量的数据,从而引发了寻找和培训这种人才的一场竞争。

雇主们说,理想的候选人必须具备超出传统的市场研究技能:能在不同来源不断提供的千百万份数据中分辨模式,根据模式推论出顾客行为,并编写具体指明行为诱因的统计模型。

例如,在电子商务运营商Etsy公司,一名曾花费数年时间挖掘医疗记录数据、寻找乳腺癌早期迹象的生物统计学家,如今在编写统计模型,以弄清人们在公司网站搜寻自己在街上看到的一种新时尚时所采用的词汇。

在移动支付创业公司Square,一位曾编写统计模型来考察人们如何改变政治信仰的认知心理学家,如今在寻找行为模式,以识别哪些商人比较可能遭到客户退款的要求。

一些此类实验引起人们的惊慌。脸谱公司最近因一项实验成为关注焦点。在实验中,公司的数据科学团队试图通过改变新闻推送内容来操纵人们的情绪。

招聘机构说,只有两年经验的数据科学家就能每年赚取20万到30万美元的收入。这种人才的稀缺性反映在数字上。一家网站的数据显示,去年底有6000家公司在招聘这种人才。

在过去两年时间里,全世界产生的数据已经超过了人类历史上的所有数据。更好的开发、分析这些信息能使我们更准确的预测人类疾病的可能性、激励创新、释放生产力以及创造新的消费服务。DSI 希望通过在医疗保健、金融服务、环境科学等领域内的学术专家和研究合作伙伴之间的“多学科合作”,找到新的解决复杂问题的方法。

研究所所长郭毅可教授对人民网记者表示,帝国理工有近20位诺贝尔奖获得者,而近些年帝国理工在科技上有很大进展,怎么样在新时代再把科技向前推进,主要是依靠数据。该数据科学研究院的特点在于各学科之间的交流。DSI还将制定一系列的研究生和行政人员课程,来培养下一代数据科学家和工程师。

伦敦帝国学院(Imperial College London)成立于1907年,全日制在校学生为13964名,学生和员工比例为12:1.1,有来自126个国家的学生在这里参与242个学校课程。根据学校提供的数据,该校在全球和欧洲高校排名中分列第10和第3位。

研究所所长郭毅可博士,清华大学毕业,1987年赴英国帝国理工学院计算科学系攻读博士,2002年被聘为英国帝国理工学院计算科学系教授。

参考消息网7月31日报道 美国《外交政策》双月刊网站7月29日发表的题为《社会实验室》的文章写道,2002年10月,新加坡国防第二部长黄永宏访问了美国国防部高级研究项目局(DARPA)。该项目局是美国国防部下属的研究机构,以研发M-16步枪、隐形飞机技术和互联网技术闻名。黄永宏会见了退役美国海军少将、时任DARPA高级项目负责人之一的约翰·波因德克斯特,他还担任过前美国总统罗纳德·里根的国家安全顾问。

黄永宏得知波因德克斯特正在展开一项新实验,旨在利用对大量电子信息的分析寻找可疑行动的模式——主要是潜在的恐怖主义袭击。

两人在弗吉尼亚州波因德克斯特的小办公室举行了会面。波因德克斯特在一块白色书写板上为黄永宏描述了其设想系统的核心理念。波因德克斯特将其称为“全面信息认知”(TIA)。该系统将收集所有方式的电子记录——电子邮件、通话记录、互联网搜索、机票预定、酒店预定、信用卡交易记录、医疗诊断报告;随后,根据预先确定的、潜在的恐怖主义策划情节,寻找可疑的袭击分子在数据空间留下的数字化“签名”或脚印。这一设想将锁定那些处于策划阶段的坏分子,并向执法部门和情报官员发出警告,对其进行干预。

黄永宏后来回忆说:“我对这一大胆的理念印象深刻——通过连接数量巨大的数据库,我们可以在大海里找一根针。”他希望知道这一系统是否能够在新加坡使用,以侦查到恐怖主义的预警迹象。

回国后,黄永宏受到启发,认为新加坡可以让类似TIA的系统发挥效用。4个月后,他的机会来了。当时,新加坡爆发SARS,造成33人死亡,导致该国经济增长大幅下滑。利用波因德克斯特的设计理念,新加坡政府迅速在国防部的一个机构内建立了“风险评估与侦测机制”(RAHS),该机构负责预防恐怖主义袭击和“非常规”攻击,如使用化学或生物武器。新加坡官员们就如何运用大数据为国家防御服务做了很多演讲并接受了大量采访。

2003年波因德克斯特离开DARPA后,他成为RAHS的一名顾问,很多美国间谍来到新加坡,研究该项目的第一手资料。他们感兴趣的不仅是新加坡采取大规模的监视行动,而且还有该国民主与专制主义之间奇怪的混合。在这种混合体中,一个家长式作风的政府可以确保人民的基本需求——住房、教育和安全——反过来又赢得了人民的尊重。这是一个法律与秩序的社会,而“秩序”的定义是包罗一切的。

在创立10年后,RAHS项目的进展已超出了波因德克斯特的想象。如今,新加坡的各政府部门及军队的文职人员使用RAHS的情景策划和大数据分析,展开除防范炸弹和极端分子以外的大量应用。他们用它来规划采购周期和预算、展开经济预测、为移民政策提供信息、研究房地产市场,以及为新加坡学龄儿童制定教育计划。

新加坡已成为一个实验室,不仅测试大规模监视和大数据分析如何防止恐怖主义,而且还测定这一技术是否能够设计一个更和谐的社会。

【延伸阅读】

智能硬件将推动大数据第二波浪潮的到来

2014-07-25 12:32:00

腾讯科技讯(韩依民)7月25日,在2014腾讯互联网与社会研究院高峰论坛上,腾讯公司即通产品部助理总经理冼业成阐释了大数据对政府、企业、个人的不同意义。并认为,智能硬件的发展,将推动大数据第二波浪潮的到来。

冼业成介绍,去年春节,腾讯公司根据QQ用户登录地点变化的数据,统计分析出春节期间人们迁徙地点的变化。这种基于大量数据统计出的结论,可以为政府在春运高峰期对交通、资源调配提供建议和参考。

这只是大数据应用的一个小例子,在大数据应用得到更加广泛应用的趋势下,大数据将可以帮助政府进行更加科学的社会治理。对企业而言,大数据可以帮助其进行更加精准的营销。比如腾讯推出的竞价广告营销系统广点通,结合人们在网路上的行为,比如在电商网站的购买、点击记录等,判断用户的消费取向,进行广告精准投放。

在未来,大数据更可以帮助建立个人的信用体系。冼业成认为,智能硬件的兴起将掀起大数据第二波浪潮的到来。智能手环可以收集到人们的健康数据、智能冰箱可以采集到家庭生活的食品数据,随着越来越多不同类型的数据出现,大数据将迎来第二波浪潮,基于这些全新的数据,互联网企业可以提供更多服务。

【延伸阅读】

谷歌启动医疗健康新项目:大数据疾病预防

2014-07-25 10:32:00

新浪科技讯 北京时间7月25日上午消息,谷歌启动了一个名为Baseline Study的全新科研项目,希望全面描绘健康人的身体究竟应该是何模样。

为了完成这一项目,谷歌将从175人那里匿名搜集基因和分子信息,之后还会再搜集数千人的相关数据。

该项目目前还处于发展初期,由50岁的分子生物学家安德鲁·康拉德(Andrew Conrad)负责。他曾经开创了便于广泛开展且成本低廉的HIV测试方式,用于对捐赠的血浆进行检测。

康纳德2013年3月加盟Google X,他已经组建了一个由70至100人组成的团队,涵盖的领域包括生理学、生物化学、光学、成像学和分子生物学。

虽然目前还有很多大型的医疗和基因研究项目存在,但Baseline搜集的信息数量更大,范围更广。他们希望帮助研究人员更早地发现心脏病和癌症的各种迹象,进而推广预防措施,而不仅仅把精力放在治疗上。

该项目并不局限于具体的疾病,而是会使用各种全新的诊断工具搜集成百上千的不同样本。之后,谷歌便会利用其庞大的计算能力来寻找这些信息中隐藏的“生物标签”,从而帮助医疗研究人员提前发现疾病。

例如,该研究可能会发现一些能够帮助人们分解高脂肪食物的生物标签。拥有这些生物标签的人,可以将患上高胆固醇和心脏病的时间延后,没有这类生物标签的人则会更早患上心脏病。一旦Baseline发现了这一标签后,研究人员便可通过检查了解哪些人缺乏这类标签,并帮助他们纠正习惯,或者开发出新的治疗方法,帮助其更好地分解高脂肪食物。

谷歌拥有当今全球规模最大的电脑网络和数据中心,可以迅速提供搜索结果和视频服务。这同样可以用于存储和分析医疗信息。

目前为止,多数已经发现的生物标签都与晚期疾病有关,因为这种研究普遍集中于病人。因此,利用现有数据尽早判断疾病的效果不佳。研究人员认为,这一新项目将成为一次意义重大的跨越,因为人体太过复杂,而科学家目前对于DNA、酶和蛋白质之间的相互作用,以及饮食等环境因素对人体的影响都知之甚少。而此次研究可以为科学家提供更多信息。

谷歌表示,Baseline将采用匿名方式进行,搜集的数据也仅限于医疗目的。这些数据不会与保险公司分享。

尽管如此,此事还是引发了很大的担忧。这些数据今后将为保险公司带来巨大的价值,他们一直以来都希望通过各类信息降低风险。除此之外,还有人可能会在招聘和结婚时参考相关数据。

Baseline将聘请杜克大学和斯坦福大学的医学院对其进行监督,由他们控制信息的使用方式。

7月8日下午消息,阿里云计算发布大数据产品——ODPS。通过ODPS在线服务,小型公司花几百元即可分析海量数据。ODPS可在6小时内处理100PB数据,相当于1亿部高清电影。此前,全球掌握这种能力的公司仅有Google、亚马逊等少数几家。

阿里云ODPS团队在一封公开信《人人都可以成为BAT》中表示:工业革命后的200多年里,人类对物理资源的利用登峰造极,对数据资源的利用却仍处于起步阶段。Google、Facebook、阿里巴巴(滚动资讯)等互联网公司先行一步,触碰到了大数据的魅力。然而,人类拥有的绝大部分数据还无法产生价值。

采用传统方案处理大规模数据,一般得耗资数千万自建数据中心,请专业技术人员维护运作。一旦数据总量超过100TB,技术挑战会非常大。Hadoop开源运动降低了这一成本,不过自建一个像样的Hadoop集群,仍然需要上百万的起步资金。专业的Hadoop人才则更加稀缺。

相比而言,使用ODPS的成本和门槛则低得多。ODPS采取按量收费的模式,目前定价0.3元/GB,即开即用,一个月内免费。根据大部分公司的数据量来测算,一般每月只需花费数百元。

在对外商用之前,ODPS只是阿里巴巴内部秘密使用。阿里小贷最先将ODPS应用到商业领域。如今,超过36万人从阿里小贷借款,最小贷款额为1元,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。阿里小贷每笔贷款成本3毛钱,不到普通银行的1/1000。

据悉,淘宝、支付宝等阿里巴巴最核心的数据业务,都运行在ODPS平台。比如阿里妈妈广告的核心算法,点击预测模型的训练等。ODPS商用,意味着阿里云将这种大数据处理能力对外开放,此举将大幅降低社会创新成本。

目前,全球提供类似服务的仅有Google和亚马逊,国内尚无同类产品可供比较。阿里云方面表示,ODPS将比Google BigQuery更强大,不仅支持更丰富的SQL语法,还将提供MapReduce编程模型和机器学习建模能力,可以服务更多应用场景。

以下为阿里云ODPS团队公开信《人人都可以成为BAT》全文:

阿里云计算最重要的一款产品——ODPS,正式开放商用。从今天起,花个几百块钱,人人都能来玩大数据。

简单来说,ODPS(Open Data Processing Service)是一项Web服务,大家不用花大钱建数据中心,就能分析海量数据。我们测过,100PB的数据任务可在6小时内跑完。这个数据量相当于1亿部高清电影。

工业革命后的200多年里,人类对物理资源的利用登峰造极。第一次信息革命过去70年了,我们对数据资源的利用却只是刚开了头。Google、Facebook、阿里巴巴等先行一步,摸到了大数据的冰山一角。然而,人类拥有的大部分数据,还无法产生价值。

如何让数据产生价值?先得拥有大规模处理能力,然后才是挖掘、算法和分析。传统的做法是这样的:租个机房,买一堆昂贵的设备搭建数据仓库,再请一帮技术人员来维护运转。一旦触发bug,或者当数据总量超过100TB时,你的工程师们可能会被这些麻烦搞崩溃。

Hadoop开源系统很伟大,大大降低了成本。阿里是中国玩Hadoop玩得最好的几家公司之一,Hadoop支撑了淘宝、支付宝早期业务的快速发展。不过,自建一个像样的Hadoop集群,得百万起步资金,专业的Hadoop人才更是稀缺。门槛还是太高。

有没有更好的方案?从2009年初,写下“飞天”第一行代码时,我们就坚信这一方案存在。我们用了五年时间,写下250万行代码,终于在自主研发的“飞天”平台上成功搭建ODPS。我们把数据海洋里的“水”灌进ODPS,设定好一套参数,拧开水龙头,出来的就是“鲜榨果汁”!

100年前,福特推出了全球第一条流水生产线。一个个零部件扔进流水线,90分钟后,一辆崭新的汽车摆在面前。不知道福特工程师们当时是怎样的心情。当我们拧开ODPS的水龙头时,感受大抵如此。这个比喻还不完全恰当,福特生产线只为福特服务,一条生产线也只能生产一种车型。而ODPS任何人都可以来用,水龙头里流出来的“果汁”,随着原始数据和算法的改变可以千变万化。

我们来看看ODPS都可以榨哪些“果汁”吧。

ODPS之前一直在阿里内部试用。第一个“小白鼠”是阿里小贷。你见过敢贷1块钱给你的银行吗?如今,超过36万人从阿里小贷借款,最小贷款额1块钱,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。另外,阿里小贷每笔贷款成本3毛钱。什么?你问普通银行的贷款成本?先乘个1000再说。

华大基因,2003年国内抗SARS研究的主力军。去年,我们邀请华大在ODPS上试了下基因测序,耗时不到传统方式的十分之一。2010年,欧洲E.coli污染危机,测序和组装耗时两天以上。如果用ODPS,只要几个小时甚至几十分钟。一旦未来真有生物危机爆发,人类可以赢得宝贵的破译时间。

这么高精尖的领域你可能觉得太遥远。说说当前最火的世界杯吧。Google拿英国体育数据提供商Opta Sports的数据,在BigQuery上跑了跑,成功预测了本届世界杯8强名单。ODPS是一款跟Google BigQuery类似的产品,如果哪位有数据,也可以来算一算接下来的比赛。

公共领域的数据挖掘,可以用ODPS吗?当然!结合中国气象局的精准预报数据,高德地图不久后就能告诉你:“前方道路已严重积水,您的车辆驶入可能会遭水淹,建议绕道行驶。”如今,每盒药品上都有一张电子身份证,从生产、流通、储存、配送、销售到使用,全过程的数据都跑在ODPS上,一旦发现问题药品,监管部门可以立即采取措施。我们期待未来每一桶油、每一道菜的数据都跑在ODPS上,食品安全问题需要通过创新的方式来解决。

生产电饭煲的工厂,应该跟ODPS没什么关系吧?别说,未来还真可能有关系。手机、电视、手表、汽车、空调……这些工业时代的经典产品,现在都变成了互联网终端。谁说电饭煲、鞋子、衣服不会呢?如果未来的制造工厂都变成互联网公司,数据将成为最基本的生产要素。你不懂算法、不会建模、不会分析,没关系,那些有数据分析能力的公司会帮你做。

眼下,阿里巴巴各项数据业务都在用ODPS“榨果汁”,比如淘宝在算你最中意哪个淘女郎,天猫在算你什么时候想吃车厘子,菜鸟在算卡车走哪条路可能会被雷劈,支付宝在算你何时会从屌丝变成高富帅。如果大家也想“榨果汁”,欢迎来试。ODPS的水龙头就装在阿里云官网aliyun.com上,一个月内免费。

The World Is Flat. 从某种意义上而言,人人都可以成为BAT,哪怕你的公司只有几号人。我们希望,在技术这件事情上,大家变得更加平等!

关键字:谷歌支付宝科学家大数据

本文摘自:参考消息

x 美媒:大数据兴起 数据科学家成热门职业 扫一扫
分享本文到朋友圈
当前位置:大数据业界动态 → 正文

美媒:大数据兴起 数据科学家成热门职业

责任编辑:editor006 |来源:企业网D1Net  2014-08-11 14:31:26 本文摘自:参考消息

参考消息网8月11日报道 美国《华尔街日报》网站8月9日报道称,克里斯·法雷尔现年28岁,是一名数据科学家。这个工作头衔3年前还不存在,但从那时以来却成为高科技劳动市场上最热门的角落之一。零售商、银行、重型设备制造厂和婚介所都想让专家从互联网、机器和智能手机上提取并分析大量的数据,从而引发了寻找和培训这种人才的一场竞争。

雇主们说,理想的候选人必须具备超出传统的市场研究技能:能在不同来源不断提供的千百万份数据中分辨模式,根据模式推论出顾客行为,并编写具体指明行为诱因的统计模型。

例如,在电子商务运营商Etsy公司,一名曾花费数年时间挖掘医疗记录数据、寻找乳腺癌早期迹象的生物统计学家,如今在编写统计模型,以弄清人们在公司网站搜寻自己在街上看到的一种新时尚时所采用的词汇。

在移动支付创业公司Square,一位曾编写统计模型来考察人们如何改变政治信仰的认知心理学家,如今在寻找行为模式,以识别哪些商人比较可能遭到客户退款的要求。

一些此类实验引起人们的惊慌。脸谱公司最近因一项实验成为关注焦点。在实验中,公司的数据科学团队试图通过改变新闻推送内容来操纵人们的情绪。

招聘机构说,只有两年经验的数据科学家就能每年赚取20万到30万美元的收入。这种人才的稀缺性反映在数字上。一家网站的数据显示,去年底有6000家公司在招聘这种人才。

在过去两年时间里,全世界产生的数据已经超过了人类历史上的所有数据。更好的开发、分析这些信息能使我们更准确的预测人类疾病的可能性、激励创新、释放生产力以及创造新的消费服务。DSI 希望通过在医疗保健、金融服务、环境科学等领域内的学术专家和研究合作伙伴之间的“多学科合作”,找到新的解决复杂问题的方法。

研究所所长郭毅可教授对人民网记者表示,帝国理工有近20位诺贝尔奖获得者,而近些年帝国理工在科技上有很大进展,怎么样在新时代再把科技向前推进,主要是依靠数据。该数据科学研究院的特点在于各学科之间的交流。DSI还将制定一系列的研究生和行政人员课程,来培养下一代数据科学家和工程师。

伦敦帝国学院(Imperial College London)成立于1907年,全日制在校学生为13964名,学生和员工比例为12:1.1,有来自126个国家的学生在这里参与242个学校课程。根据学校提供的数据,该校在全球和欧洲高校排名中分列第10和第3位。

研究所所长郭毅可博士,清华大学毕业,1987年赴英国帝国理工学院计算科学系攻读博士,2002年被聘为英国帝国理工学院计算科学系教授。

参考消息网7月31日报道 美国《外交政策》双月刊网站7月29日发表的题为《社会实验室》的文章写道,2002年10月,新加坡国防第二部长黄永宏访问了美国国防部高级研究项目局(DARPA)。该项目局是美国国防部下属的研究机构,以研发M-16步枪、隐形飞机技术和互联网技术闻名。黄永宏会见了退役美国海军少将、时任DARPA高级项目负责人之一的约翰·波因德克斯特,他还担任过前美国总统罗纳德·里根的国家安全顾问。

黄永宏得知波因德克斯特正在展开一项新实验,旨在利用对大量电子信息的分析寻找可疑行动的模式——主要是潜在的恐怖主义袭击。

两人在弗吉尼亚州波因德克斯特的小办公室举行了会面。波因德克斯特在一块白色书写板上为黄永宏描述了其设想系统的核心理念。波因德克斯特将其称为“全面信息认知”(TIA)。该系统将收集所有方式的电子记录——电子邮件、通话记录、互联网搜索、机票预定、酒店预定、信用卡交易记录、医疗诊断报告;随后,根据预先确定的、潜在的恐怖主义策划情节,寻找可疑的袭击分子在数据空间留下的数字化“签名”或脚印。这一设想将锁定那些处于策划阶段的坏分子,并向执法部门和情报官员发出警告,对其进行干预。

黄永宏后来回忆说:“我对这一大胆的理念印象深刻——通过连接数量巨大的数据库,我们可以在大海里找一根针。”他希望知道这一系统是否能够在新加坡使用,以侦查到恐怖主义的预警迹象。

回国后,黄永宏受到启发,认为新加坡可以让类似TIA的系统发挥效用。4个月后,他的机会来了。当时,新加坡爆发SARS,造成33人死亡,导致该国经济增长大幅下滑。利用波因德克斯特的设计理念,新加坡政府迅速在国防部的一个机构内建立了“风险评估与侦测机制”(RAHS),该机构负责预防恐怖主义袭击和“非常规”攻击,如使用化学或生物武器。新加坡官员们就如何运用大数据为国家防御服务做了很多演讲并接受了大量采访。

2003年波因德克斯特离开DARPA后,他成为RAHS的一名顾问,很多美国间谍来到新加坡,研究该项目的第一手资料。他们感兴趣的不仅是新加坡采取大规模的监视行动,而且还有该国民主与专制主义之间奇怪的混合。在这种混合体中,一个家长式作风的政府可以确保人民的基本需求——住房、教育和安全——反过来又赢得了人民的尊重。这是一个法律与秩序的社会,而“秩序”的定义是包罗一切的。

在创立10年后,RAHS项目的进展已超出了波因德克斯特的想象。如今,新加坡的各政府部门及军队的文职人员使用RAHS的情景策划和大数据分析,展开除防范炸弹和极端分子以外的大量应用。他们用它来规划采购周期和预算、展开经济预测、为移民政策提供信息、研究房地产市场,以及为新加坡学龄儿童制定教育计划。

新加坡已成为一个实验室,不仅测试大规模监视和大数据分析如何防止恐怖主义,而且还测定这一技术是否能够设计一个更和谐的社会。

【延伸阅读】

智能硬件将推动大数据第二波浪潮的到来

2014-07-25 12:32:00

腾讯科技讯(韩依民)7月25日,在2014腾讯互联网与社会研究院高峰论坛上,腾讯公司即通产品部助理总经理冼业成阐释了大数据对政府、企业、个人的不同意义。并认为,智能硬件的发展,将推动大数据第二波浪潮的到来。

冼业成介绍,去年春节,腾讯公司根据QQ用户登录地点变化的数据,统计分析出春节期间人们迁徙地点的变化。这种基于大量数据统计出的结论,可以为政府在春运高峰期对交通、资源调配提供建议和参考。

这只是大数据应用的一个小例子,在大数据应用得到更加广泛应用的趋势下,大数据将可以帮助政府进行更加科学的社会治理。对企业而言,大数据可以帮助其进行更加精准的营销。比如腾讯推出的竞价广告营销系统广点通,结合人们在网路上的行为,比如在电商网站的购买、点击记录等,判断用户的消费取向,进行广告精准投放。

在未来,大数据更可以帮助建立个人的信用体系。冼业成认为,智能硬件的兴起将掀起大数据第二波浪潮的到来。智能手环可以收集到人们的健康数据、智能冰箱可以采集到家庭生活的食品数据,随着越来越多不同类型的数据出现,大数据将迎来第二波浪潮,基于这些全新的数据,互联网企业可以提供更多服务。

【延伸阅读】

谷歌启动医疗健康新项目:大数据疾病预防

2014-07-25 10:32:00

新浪科技讯 北京时间7月25日上午消息,谷歌启动了一个名为Baseline Study的全新科研项目,希望全面描绘健康人的身体究竟应该是何模样。

为了完成这一项目,谷歌将从175人那里匿名搜集基因和分子信息,之后还会再搜集数千人的相关数据。

该项目目前还处于发展初期,由50岁的分子生物学家安德鲁·康拉德(Andrew Conrad)负责。他曾经开创了便于广泛开展且成本低廉的HIV测试方式,用于对捐赠的血浆进行检测。

康纳德2013年3月加盟Google X,他已经组建了一个由70至100人组成的团队,涵盖的领域包括生理学、生物化学、光学、成像学和分子生物学。

虽然目前还有很多大型的医疗和基因研究项目存在,但Baseline搜集的信息数量更大,范围更广。他们希望帮助研究人员更早地发现心脏病和癌症的各种迹象,进而推广预防措施,而不仅仅把精力放在治疗上。

该项目并不局限于具体的疾病,而是会使用各种全新的诊断工具搜集成百上千的不同样本。之后,谷歌便会利用其庞大的计算能力来寻找这些信息中隐藏的“生物标签”,从而帮助医疗研究人员提前发现疾病。

例如,该研究可能会发现一些能够帮助人们分解高脂肪食物的生物标签。拥有这些生物标签的人,可以将患上高胆固醇和心脏病的时间延后,没有这类生物标签的人则会更早患上心脏病。一旦Baseline发现了这一标签后,研究人员便可通过检查了解哪些人缺乏这类标签,并帮助他们纠正习惯,或者开发出新的治疗方法,帮助其更好地分解高脂肪食物。

谷歌拥有当今全球规模最大的电脑网络和数据中心,可以迅速提供搜索结果和视频服务。这同样可以用于存储和分析医疗信息。

目前为止,多数已经发现的生物标签都与晚期疾病有关,因为这种研究普遍集中于病人。因此,利用现有数据尽早判断疾病的效果不佳。研究人员认为,这一新项目将成为一次意义重大的跨越,因为人体太过复杂,而科学家目前对于DNA、酶和蛋白质之间的相互作用,以及饮食等环境因素对人体的影响都知之甚少。而此次研究可以为科学家提供更多信息。

谷歌表示,Baseline将采用匿名方式进行,搜集的数据也仅限于医疗目的。这些数据不会与保险公司分享。

尽管如此,此事还是引发了很大的担忧。这些数据今后将为保险公司带来巨大的价值,他们一直以来都希望通过各类信息降低风险。除此之外,还有人可能会在招聘和结婚时参考相关数据。

Baseline将聘请杜克大学和斯坦福大学的医学院对其进行监督,由他们控制信息的使用方式。

7月8日下午消息,阿里云计算发布大数据产品——ODPS。通过ODPS在线服务,小型公司花几百元即可分析海量数据。ODPS可在6小时内处理100PB数据,相当于1亿部高清电影。此前,全球掌握这种能力的公司仅有Google、亚马逊等少数几家。

阿里云ODPS团队在一封公开信《人人都可以成为BAT》中表示:工业革命后的200多年里,人类对物理资源的利用登峰造极,对数据资源的利用却仍处于起步阶段。Google、Facebook、阿里巴巴(滚动资讯)等互联网公司先行一步,触碰到了大数据的魅力。然而,人类拥有的绝大部分数据还无法产生价值。

采用传统方案处理大规模数据,一般得耗资数千万自建数据中心,请专业技术人员维护运作。一旦数据总量超过100TB,技术挑战会非常大。Hadoop开源运动降低了这一成本,不过自建一个像样的Hadoop集群,仍然需要上百万的起步资金。专业的Hadoop人才则更加稀缺。

相比而言,使用ODPS的成本和门槛则低得多。ODPS采取按量收费的模式,目前定价0.3元/GB,即开即用,一个月内免费。根据大部分公司的数据量来测算,一般每月只需花费数百元。

在对外商用之前,ODPS只是阿里巴巴内部秘密使用。阿里小贷最先将ODPS应用到商业领域。如今,超过36万人从阿里小贷借款,最小贷款额为1元,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。阿里小贷每笔贷款成本3毛钱,不到普通银行的1/1000。

据悉,淘宝、支付宝等阿里巴巴最核心的数据业务,都运行在ODPS平台。比如阿里妈妈广告的核心算法,点击预测模型的训练等。ODPS商用,意味着阿里云将这种大数据处理能力对外开放,此举将大幅降低社会创新成本。

目前,全球提供类似服务的仅有Google和亚马逊,国内尚无同类产品可供比较。阿里云方面表示,ODPS将比Google BigQuery更强大,不仅支持更丰富的SQL语法,还将提供MapReduce编程模型和机器学习建模能力,可以服务更多应用场景。

以下为阿里云ODPS团队公开信《人人都可以成为BAT》全文:

阿里云计算最重要的一款产品——ODPS,正式开放商用。从今天起,花个几百块钱,人人都能来玩大数据。

简单来说,ODPS(Open Data Processing Service)是一项Web服务,大家不用花大钱建数据中心,就能分析海量数据。我们测过,100PB的数据任务可在6小时内跑完。这个数据量相当于1亿部高清电影。

工业革命后的200多年里,人类对物理资源的利用登峰造极。第一次信息革命过去70年了,我们对数据资源的利用却只是刚开了头。Google、Facebook、阿里巴巴等先行一步,摸到了大数据的冰山一角。然而,人类拥有的大部分数据,还无法产生价值。

如何让数据产生价值?先得拥有大规模处理能力,然后才是挖掘、算法和分析。传统的做法是这样的:租个机房,买一堆昂贵的设备搭建数据仓库,再请一帮技术人员来维护运转。一旦触发bug,或者当数据总量超过100TB时,你的工程师们可能会被这些麻烦搞崩溃。

Hadoop开源系统很伟大,大大降低了成本。阿里是中国玩Hadoop玩得最好的几家公司之一,Hadoop支撑了淘宝、支付宝早期业务的快速发展。不过,自建一个像样的Hadoop集群,得百万起步资金,专业的Hadoop人才更是稀缺。门槛还是太高。

有没有更好的方案?从2009年初,写下“飞天”第一行代码时,我们就坚信这一方案存在。我们用了五年时间,写下250万行代码,终于在自主研发的“飞天”平台上成功搭建ODPS。我们把数据海洋里的“水”灌进ODPS,设定好一套参数,拧开水龙头,出来的就是“鲜榨果汁”!

100年前,福特推出了全球第一条流水生产线。一个个零部件扔进流水线,90分钟后,一辆崭新的汽车摆在面前。不知道福特工程师们当时是怎样的心情。当我们拧开ODPS的水龙头时,感受大抵如此。这个比喻还不完全恰当,福特生产线只为福特服务,一条生产线也只能生产一种车型。而ODPS任何人都可以来用,水龙头里流出来的“果汁”,随着原始数据和算法的改变可以千变万化。

我们来看看ODPS都可以榨哪些“果汁”吧。

ODPS之前一直在阿里内部试用。第一个“小白鼠”是阿里小贷。你见过敢贷1块钱给你的银行吗?如今,超过36万人从阿里小贷借款,最小贷款额1块钱,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。另外,阿里小贷每笔贷款成本3毛钱。什么?你问普通银行的贷款成本?先乘个1000再说。

华大基因,2003年国内抗SARS研究的主力军。去年,我们邀请华大在ODPS上试了下基因测序,耗时不到传统方式的十分之一。2010年,欧洲E.coli污染危机,测序和组装耗时两天以上。如果用ODPS,只要几个小时甚至几十分钟。一旦未来真有生物危机爆发,人类可以赢得宝贵的破译时间。

这么高精尖的领域你可能觉得太遥远。说说当前最火的世界杯吧。Google拿英国体育数据提供商Opta Sports的数据,在BigQuery上跑了跑,成功预测了本届世界杯8强名单。ODPS是一款跟Google BigQuery类似的产品,如果哪位有数据,也可以来算一算接下来的比赛。

公共领域的数据挖掘,可以用ODPS吗?当然!结合中国气象局的精准预报数据,高德地图不久后就能告诉你:“前方道路已严重积水,您的车辆驶入可能会遭水淹,建议绕道行驶。”如今,每盒药品上都有一张电子身份证,从生产、流通、储存、配送、销售到使用,全过程的数据都跑在ODPS上,一旦发现问题药品,监管部门可以立即采取措施。我们期待未来每一桶油、每一道菜的数据都跑在ODPS上,食品安全问题需要通过创新的方式来解决。

生产电饭煲的工厂,应该跟ODPS没什么关系吧?别说,未来还真可能有关系。手机、电视、手表、汽车、空调……这些工业时代的经典产品,现在都变成了互联网终端。谁说电饭煲、鞋子、衣服不会呢?如果未来的制造工厂都变成互联网公司,数据将成为最基本的生产要素。你不懂算法、不会建模、不会分析,没关系,那些有数据分析能力的公司会帮你做。

眼下,阿里巴巴各项数据业务都在用ODPS“榨果汁”,比如淘宝在算你最中意哪个淘女郎,天猫在算你什么时候想吃车厘子,菜鸟在算卡车走哪条路可能会被雷劈,支付宝在算你何时会从屌丝变成高富帅。如果大家也想“榨果汁”,欢迎来试。ODPS的水龙头就装在阿里云官网aliyun.com上,一个月内免费。

The World Is Flat. 从某种意义上而言,人人都可以成为BAT,哪怕你的公司只有几号人。我们希望,在技术这件事情上,大家变得更加平等!

关键字:谷歌支付宝科学家大数据

本文摘自:参考消息

电子周刊
回到顶部

关于我们联系我们版权声明隐私条款广告服务友情链接投稿中心招贤纳士

企业网版权所有 ©2010-2024 京ICP备09108050号-6 京公网安备 11010502049343号

^