Reddit热议!1030亿词元纯人类Usenet语料库引发版权争议
2026-05-28 20:13:56
23次阅读
3个评论
一位开发者耗时数年构建了1980-2013年间的Usenet语料库,声称零AI污染、适合微调,但提供免费样本后需付费获取完整版。网友激烈反对:多数人认为Usenet内容版权属于原发帖者,开发者无权商业授权;也有人质疑其数据已被大公司提前抓取,且发帖本身疑似AI生成。
0
0
2026-05-28 20:14:29

回复 |
引用
2026-05-28 20:14:57

回复 |
引用
2026-05-28 20:15:26

回复 |
引用
共3条
1