下载APP | 繁體版 | 发布广告 |常用工具

英伟达版Sora被曝违规抓取大量数据,官方表示不服

京港台:2024-8-6 12:00| 来源:量子位 | 我来说几句


英伟达版Sora被曝违规抓取大量数据,官方表示不服

来源:倍可亲(backchina.com) 专题:抄底还是跑路?美股最新动态

  英伟达版Sora曝光——

  代号Cosmos,研究副总裁刘洺堉担任负责人。

  不过随着几份内部文件的泄露,他们还被曝非法抓取数据。

  (确实这也不是一次两次了……)

  员工被默许每天在网络上抓取任何未经授权、未经同意数据,比如YouTube、奈飞等等这种平台上。

  合起来,每天抓取的几乎是一个人80年能感知到的视觉数据。

  结果英伟达回应称:我们这做法,完全合法!

  英伟达版Sora曝光:代号Cosmos

  据404Media所获取的泄密文件显示,英伟达每天都会抓取非法数据来训练新模型。

  Cosmos的目标是构建一个最先进的视频基础模型。据泄露的邮件显示该模型集合了光传输、物理和智能的模拟,以解锁对各种下游应用。

  

  图源:404 Media

  比如被用到Omniverse 3D 世界生成器、自动驾驶汽车系统和数字人产品。

  英伟达研究副总裁Ming-Yu Liu(刘洺堉)担任Cosmos的项目负责人。

  他同时也是IEEE Fellow。他带领英伟达Deep Imagination研究小组,推出了NVIDIA Picasso [Edify]、NVIDIA Canvas [GauGAN]和NVIDIA Maxine [LivePortrait]等产品。

  此前5月份的一封电子邮件中显示:

  我们正在完成 v1 数据管道并确保必要的计算资源,以构建一个视频数据工厂,该工厂每天可以产生相当于人类一生视觉体验的训练数据。

  这张图中显示英伟达首席科学家 Francesco Ferroni给了个表格链接,里面汇集了各种视频数据集,包括 MovieNet(一个包含 60,000 个电影预告片的数据库)、WebVid、 InternVid-10M,以及几个内部捕获的视频游戏镜头数据集。

  如今据一位前员工爆料称,员工会被要求从YouTube、奈飞等来源来抓取数据。

  他们会使用一个名为yt-dlp的开源YouTube视频下载器,它能使用虚拟机来刷新IP地址,以避免被YouTube屏蔽。

  为此,英伟达向404 Media回应称:

  我们尊重所有内容创作者的权利,并相信我们的模型和研究工作完全符合版权法的条文和精神。

  版权法保护特定的表达方式,但不保护事实、想法、数据或信息。任何人都可以自由地从其他来源了解事实、想法、数据或信息,并用它来表达自己的观点。合理使用还保护将作品用于变革性目的的能力,例如模型训练。”

  而谷歌则是扔给404 Media一个链接,今年4月YouTube CEO表示,如果OpenAI用YouTube视频来训练Sora,那么明显违反YouTube的使用条款。

  而奈飞则表示,他们并未与英伟达达成内容提取协议,而且该平台的服务条款不允许抓取内容。

  有意思的是,同一天,YouTube博主正在寻求对OpenAI集体诉讼,指控该公司在未通知或补偿视频所有者的情况下,使用数百万条 YouTube 视频记录来训练其生成式 AI 模型。

  而此前这些大厂被曝非法抓取数据的事情也屡见不鲜。

  不过必须要说的是,这种原始数据真的很有用…

  之前英伟达还用游戏视频,来改善训练数据质量。

  最近登上Nature封面的那篇研究显示,这种用最初互联网数据训练的大模型,具有先发优势,数据质量最好,对应的模型性能也最好。

  之后随着AI数据越来越泛滥,反而容易让大模型崩溃。

  Garbage in,Garbage out

  这家最好!股市开户分批买入大盘股指基金

相关专题:美股动态

推荐:美国打折网(21usDeal.com)    >>

        更多科技前沿 文章    >>

【郑重声明】倍可亲刊载此文不代表同意其说法或描述,仅为提供更多信息,也不构成任何投资或其他建议。转载需经倍可亲同意并注明出处。本网站有部分文章是由网友自由上传,对于此类文章本站仅提供交流平台,不为其版权负责;部分内容经社区和论坛转载,原作者未知,如果您发现本网站上有侵犯您的知识产权的文章,请及时与我们联络,我们会及时删除或更新作者。

关于本站 | 隐私政策 | 免责条款 | 版权声明 | 联络我们 | 刊登广告 | 转手机版 | APP下载

Copyright © 2001-2025 海外华人中文门户:倍可亲 (http://www.backchina.com) All Rights Reserved.

程序系统基于 Discuz! X3.1 商业版 优化 Discuz! © 2001-2013 Comsenz Inc. 更新:GMT+8, 2025-4-30 22:40

倍可亲服务器位于美国圣何塞、西雅图和达拉斯顶级数据中心,为更好服务全球网友特统一使用京港台时间

返回顶部