为吸引人工智能专家 雅虎公布13.5TB用户数据_科技_腾讯网



为吸引人工智能专家 雅虎公布13.5TB用户数据_科技_腾讯网

卡内基梅隆大学计算机学院院长安德鲁・穆尔(Andrew Moore)表示:"无论你拥有多少人才,管理者总是希望招募更多的人才。这些大型科技公司总觉得缺少某类研发人才。"

海量数据是机器学习的必备要素。利用这些数据,电脑可分析复杂的模式,根据雅虎的情况给出科学的建议,例如哪种标题或设计更加吸引纽约地区的年轻女孩。大型互联网公司一般严格控制这类数据,外部人士极难获得。雅虎此次公布的数据体积为13.5 TB,相当于美国国会图书馆数据体积的2/3。

穆尔表示,绝大多数学术计算机科学家未曾接触如此庞大的用户数据,学者可能要把数据存储到大学外部的服务器,他们可能选择亚马逊或谷歌的云计算中心。

去年,雅虎和卡内基梅隆大学签署一份为期5年的合作合同,雅虎将为卡内基梅隆大学提供1000万美元研究资金,目的是基于用户数据开发个性化应用。

加州大学圣地亚哥分校电子与计算机系教授格特・兰克利(Gert Lanckriet)表示:"公司外部人士难以获得数据。"

专家认为,雅虎数据的规模使其极具价值。相较针对少量数据设计的算法,针对海量数据设计的算法具有本质区别。雅虎的数据可以让研究人员开发大型算法,这种算法尤其适合企业。

自2006年以来,雅虎已经发布了50多个数据集,包括2014年的1亿张Flickr照片缓存。此前,雅虎公布的最大数据集为413 GB。谷歌和亚马逊公布的数据集相对较小。

数据科学初创公司Fast Forward Labs创始人希拉里・梅森(Hilary Mason)表示,一方面,科技公司要吸引人才和催生新理念。另一方面,它们要保护用户隐私和保持竞争优势。这种矛盾正逐渐加大。

梅森称,众多大型科技公司正尝试打造同样的功能,例如无人驾驶汽车、图像识别和个性化服务。公布用户数据之后,雅虎承担些许暴露商业秘密的危险,但雅虎认为吸引人才能带来更大回报。

尽管数家公司曾面向研究人员公布用户数据,但结果令人失望。2006年,AOL向研究人员公布用户数据,但意外泄露用户的搜索记录。2009年,Netflix公布大量用户的电影推荐和日志,并提供100万美元奖金,以奖励改进电影推荐算法的开发者。在两个例子中,外部人员都利用数据推测用户的身份,这种侵犯隐私的行为招致集体诉讼。Netflix被迫取消该奖项。

2014年,Facebook和康乃尔大学共同研究和操纵用户的情绪。研究过程中,Facebook调整用户信息流的内容,旨在研究用户的情绪反应,此举引发了巨大争议。随后,Facebook不得不限制用户数据的使用范围。

梅森表示:"自从2006年AOL遭遇隐私灾难,科技公司一直害怕公布数据。"

雅虎数据的敏感度似乎较低,其中仅包括城市、性别、年龄等基本人口统计信息,以及用户与雅虎网站相关的交互信息。

雅虎实验室首席研究科学家贝泽・耶茨(Ricardo Baeza-Yates) 表示,这次公布的数据集能够有效地防止个人追踪用户。例如,雅虎移除了来自人口稀少地区的用户信息。(熠辉)


Read full article from 为吸引人工智能专家 雅虎公布13.5TB用户数据_科技_腾讯网


No comments:

Post a Comment

Labels

Algorithm (219) Lucene (130) LeetCode (97) Database (36) Data Structure (33) text mining (28) Solr (27) java (27) Mathematical Algorithm (26) Difficult Algorithm (25) Logic Thinking (23) Puzzles (23) Bit Algorithms (22) Math (21) List (20) Dynamic Programming (19) Linux (19) Tree (18) Machine Learning (15) EPI (11) Queue (11) Smart Algorithm (11) Operating System (9) Java Basic (8) Recursive Algorithm (8) Stack (8) Eclipse (7) Scala (7) Tika (7) J2EE (6) Monitoring (6) Trie (6) Concurrency (5) Geometry Algorithm (5) Greedy Algorithm (5) Mahout (5) MySQL (5) xpost (5) C (4) Interview (4) Vi (4) regular expression (4) to-do (4) C++ (3) Chrome (3) Divide and Conquer (3) Graph Algorithm (3) Permutation (3) Powershell (3) Random (3) Segment Tree (3) UIMA (3) Union-Find (3) Video (3) Virtualization (3) Windows (3) XML (3) Advanced Data Structure (2) Android (2) Bash (2) Classic Algorithm (2) Debugging (2) Design Pattern (2) Google (2) Hadoop (2) Java Collections (2) Markov Chains (2) Probabilities (2) Shell (2) Site (2) Web Development (2) Workplace (2) angularjs (2) .Net (1) Amazon Interview (1) Android Studio (1) Array (1) Boilerpipe (1) Book Notes (1) ChromeOS (1) Chromebook (1) Codility (1) Desgin (1) Design (1) Divide and Conqure (1) GAE (1) Google Interview (1) Great Stuff (1) Hash (1) High Tech Companies (1) Improving (1) LifeTips (1) Maven (1) Network (1) Performance (1) Programming (1) Resources (1) Sampling (1) Sed (1) Smart Thinking (1) Sort (1) Spark (1) Stanford NLP (1) System Design (1) Trove (1) VIP (1) tools (1)

Popular Posts