GPT-5不远了!OpenAI推出网络爬虫GPTBot,自动抓取数据,可选择性关闭
创始人
2025-06-28 18:31:13
0

前段时间,抓取平台用户数据风波,Reddit网友吵翻了天。

今天,OpenAI推出了一个网络爬虫工具GPTBot,能够自动抓取网站的数据。

如何使用?

OpenAI在发布的文档中表示,网络爬虫将过滤删除需要付费强访问的来源,同时也会删除个人身份信息(PII)或违反其政策的文本。

GPTBot抓取的数据,被用来训练GPT-4或GPT-5,能够提升未来人工智能系统的准确性和能力。

可通过以下代码识别该工具:

User agent token: GPTBot
Full user-agent string: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)

禁止GPTBot访问

另一方面,你也可以通过将GPTBot添加到站点robots. txt,来禁止其访问网站。

这意味着,网站所有者必须自愿采取措施,禁止OpenAI对自己的网站访问,不将自己的数据用来训练。

User-agent: GPTBot
Disallow: /

自定义GPTBot访问

你还可以通过以下代码,来控制GPTBot对网站部分内容的访问。

User-agent: GPTBot
Allow: /directory-1/
Disallow: /directory-2/

IP出口

对于OpenAI的爬虫,将从OpenAI网站上记录的IP地址块调用网站。

图片

网友热议

OpenAI此举引发了网友对用于训练AI模型的网络爬虫的道德问题的讨论。

「OpenAI甚至没有适度引用。它是在制作衍生作品,却没有引用,从而掩盖了它的事实。」

图片

网友表示,终于有机会阻止OpenAI抓取你的网络数据,来训练模型。

还有人表示,ChatGPT浏览器插件已被移除一段时间,部分原因是它可以访问付费墙后面的内容。

前段时间,OpenAI于7月18日向美国专利局提交了GPT-5的商标申请,暗示着公司正在训练更高级的AI系统。

GPTBot显然将帮助该OpenAI从互联网上收集更多数据来训练这个模型。

相关内容

热门资讯

如何允许远程连接到MySQL数... [[277004]]【51CTO.com快译】默认情况下,MySQL服务器仅侦听来自localhos...
如何利用交换机和端口设置来管理... 在网络管理中,总是有些人让管理员头疼。下面我们就将介绍一下一个网管员利用交换机以及端口设置等来进行D...
施耐德电气数据中心整体解决方案... 近日,全球能效管理专家施耐德电气正式启动大型体验活动“能效中国行——2012卡车巡展”,作为该活动的...
20个非常棒的扁平设计免费资源 Apple设备的平面图标PSD免费平板UI 平板UI套件24平图标Freen平板UI套件PSD径向平...
德国电信门户网站可实时显示全球... 德国电信周三推出一个门户网站,直观地实时提供其安装在全球各地的传感器网络检测到的网络攻击状况。该网站...
为啥国人偏爱 Mybatis,... 关于 SQL 和 ORM 的争论,永远都不会终止,我也一直在思考这个问题。昨天又跟群里的小伙伴进行...
《非诚勿扰》红人闫凤娇被曝厕所... 【51CTO.com 综合消息360安全专家提醒说,“闫凤娇”、“非诚勿扰”已经被黑客盯上成为了“木...
2012年第四季度互联网状况报... [[71653]]  北京时间4月25日消息,据国外媒体报道,全球知名的云平台公司Akamai Te...