英伟达版 Sora 曝光:代号 Cosmos,非法抓取数据引争议

aixo 2024-08-06 16:09:44
算力 2024-08-06 16:09:44

英伟达版Sora曝光——

代号,研究副总裁刘洺堉担任负责人。

不过随着几份内部文件的泄露,他们还被曝非法抓取数据。

(确实这也不是一次两次了……)

员工被默许每天在网络上抓取任何未经授权、未经同意数据,比如、奈飞等等这种平台上。

合起来,每天抓取的几乎是一个人80年能感知到的视觉数据。

结果英伟达回应称:我们这做法,完全合法!

英伟达版Sora曝光:代号

据所获取的泄密文件显示,英伟达每天都会抓取非法数据来训练新模型。

的目标是构建一个最先进的视频基础模型。据泄露的邮件显示该模型集合了光传输、物理和智能的模拟,以解锁对各种下游应用。

比如被用到 3D 世界生成器、自动驾驶汽车系统和数字人产品。

英伟达研究副总裁Ming-Yu Liu(刘洺堉)担任的项目负责人。

他同时也是IEEE 。他带领英伟达Deep 研究小组,推出了 [Edify]、 []和 []等产品。

此前5月份的一封电子邮件中显示:

这张图中显示英伟达首席科学家 给了个表格链接,里面汇集了各种视频数据集,包括 (一个包含 60,000 个电影预告片的数据库)、、 -10M,以及几个内部捕获的视频游戏镜头数据集。

如今据一位前员工爆料称,员工会被要求从、奈飞等来源来抓取数据。

他们会使用一个名为yt-dlp的开源视频下载器,它能使用虚拟机来刷新IP地址,以避免被屏蔽。

为此,英伟达向404 Media回应称:

而谷歌则是扔给404 Media一个链接,今年4月 CEO表示,如果用视频来训练Sora,那么明显违反的使用条款。

而奈飞则表示,他们并未与英伟达达成内容提取协议,而且该平台的服务条款不允许抓取内容。

有意思的是,同一天,博主正在寻求对集体诉讼,指控该公司在未通知或补偿视频所有者的情况下,使用数百万条 视频记录来训练其生成式 AI 模型。

而此前这些大厂被曝非法抓取数据的事情也屡见不鲜。

不过必须要说的是,这种原始数据真的很有用…

之前英伟达还用游戏视频,来改善训练数据质量。

最近登上封面的那篇研究显示,这种用最初互联网数据训练的大模型,具有先发优势,数据质量最好,对应的模型性能也最好。

之后随着AI数据越来越泛滥,反而容易让大模型崩溃。

in, out。

对于这件事,你怎么看呢?

参考链接:

[1]

[2]

[3]

[4]

海量资讯、精准解读,尽在新浪财经APP