OpenAI爬虫每天狂刷十几万次,300G日志差点把服务器拖垮

admin 2026-07-19 04:32:26 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 文章记录了OpenAI爬虫GPTBot导致服务器日志异常的事件,每天产生十几万次访问和300GB日志,流量流向境外。通过分析Nginx日志发现来源IP和请求头特征,最终在robots.txt中配置User-agent:GPTBot/Disallow:/来阻止爬取。建议定期监控出口流量异常,及时配置robots.txt。 综合评分: 80 文章分类: 安全运营,威胁情报,安全工具,WEB安全,数据安全


cover_image

OpenAI爬虫每天狂刷十几万次,300G日志差点把服务器拖垮

剁椒Muyou鱼头

2026年7月18日 15:30 山东

在小说阅读器读本章

去阅读

阅读须知

本公众号文章皆为网上公开的漏洞,仅供日常学习使用,未经授权请勿利用文章中的技术资料对任何计算机系统进行入侵操作。利用此文所提供的信息而造成的直接或间接后果和损失,均由使用者本人负责。

朋友们现在只对常读和星标的公众号才展示大图推送,建议大家把剁椒Muyou鱼头“设为星标”,否则可能就看不到了啦!

2026/07/18 星期六

//01 前言

前段时间协助处理了一起数据异常出境事件,不说别的,先上几个数字让你感受一下:每天400MB-1GB的数据流量流向多个国家,通信连接次数上万,累计几十GB的总数据量。

跑到现场排查了一圈,发现罪魁祸首竟然是OpenAI的爬虫GPTBot。这篇文章就把整个排查过程记录下来,供大家参考。

//02 GPTbot是什么

GPTBot是OpenAI在2023年8月推出的网络爬虫,主要用来爬取公开网页上的文本、代码等内容,用于训练和改进大模型。

OpenAI的说法是:这个爬虫会遵守付费墙规则,不抓取需要付费的内容,也不收集个人身份信息。网站管理员可以通过robots.txt文件或封禁指定IP来阻止它。

OpenAI还公布了OpenAI使用的爬虫IP地址,也可以根据IP地址来拒绝访问。不过话说回来,OpenAI把数据收了,隐私、版权、数据安全的争议可一点没少。你网站没设防,它默认就是可以爬的。

//03 日志排查过程

这套出问题的系统跑的是 Nginx。打开 access.log 一看,好家伙,300 多个 GB。这是我第一次见这么大的日志文件,直接拿文本编辑器根本打不开,一开就卡死。

🛠 排查小工具推荐

推荐 LogViewPro,一款可以秒开超大日志文件的工具(4GB+ 无压力),支持高亮关键字(警告、错误等),排查日志时非常实用。

我们只能先把日志从服务器备份到移动硬盘,再接到主机上慢慢分析。一分析,问题全暴露了:

🔍 排查发现

  • GPTBot 大面积爬取网站的 HTML、CSS、JS、JPEG、PNG 等资源。
  • 单日访问量超过十几万次。
  • 来源 IP 全部落在 20.171.207.0/24 这个 /24 网段。
  • 请求头全部携带 gptbot 字段。

说真的,也亏得这台服务器配置还行,不然网站早就被爬崩了。当爬虫请求量达到这种规模,本质上已经接近一次DDoS攻击的效果,资源耗尽、响应变慢、甚至直接瘫痪。

//04 怎么禁掉GPTBot

按OpenAI的说法,GPTBot会遵循robots.txt里的规则。所以最简单的做法是:在网站根目录的robots.txt加上下面这段配置:

User-agent: GPTBotDisallow: /

加上这段之后,GPTBot理论上就不会再来爬了。

🤔 但有个问题值得想想

OpenAI 这套逻辑说白了就是:你不设 robots.txt 规则 = 你默许我爬。把防止抓取的责任完全推给了网站方自己。这到底算不算合规?如果爬虫把网站搞瘫痪了,追责又该怎么算?目前这些问题在法律层面还没有特别清晰的答案。

//05 结尾

整个事件复盘下来,值得留意的就几点:

| | | | — | — | | 1. | GPTBot 会无差别爬取公开网页的文本、代码等资源,用于 OpenAI 的模型训练。 | | 2. | 当爬取量过大时,会产生海量异常流量,且流量会流向境外多个国家。 | | 3. | 解决办法:在 robots.txt 中配置 User-agent: GPTBot / Disallow: /。 | | 4. | 建议定期关注出口流量异常,尤其是与境外 IP 的通信量。 |

如果你也碰到类似问题,最直接的办法就是先把robots.txt 配好,别等到出口流量异常被通报了才发现。

  END


 作者 | 剁椒Muyou鱼头

I like you,but just like you.

我喜欢你,仅仅如此,喜欢而已~

点赞在看不迷路哦!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:剁椒Muyou鱼头 《OpenAI爬虫每天狂刷十几万次,300G日志差点把服务器拖垮》

可解释性与机械可解释性 网络安全文章

可解释性与机械可解释性

文章总结: 本文系统梳理机器学习可解释性与机械可解释性理论。对比指出LIME和SHAP等传统方法仅提供事后近似解释,易生幻觉;机械可解释性则通过电路分析与激活修
评论:0   参与:  0