警惕!你的数据快被AI爬虫爬完了!
创始人
2024-07-31 15:09:33
0

最近一两年,全世界科技圈最火的话题就是AI大模型了。各种文生文、文生图乃至文生视频大模型横空出世,顷刻间满足了人类对未来世界的畅想,诞生了无数商机与可能性。各家人工智能公司都摩拳擦掌,倾尽全力打造自己的大模型,希望能在这场全新的科技拉力赛中占据领先位置。

但,繁荣和进步的背后,也隐藏着巨大的数据安全危机。

众所周知,海量的数据是训练大模型的必备材料。就像想发动一辆车需要汽油一样,想把大模型训练好,就需要大量优质的数据来做“汽油”。比如,OpenAI在训练GPT-4时使用了大约13万亿个token,按照Epoch的研究员Pablo Villalobos预测,GPT-5大约需要60到100万亿个token才能实现预期中的效果增长。而这些token,正来自于海量的数据。

而规模如此庞大的数据又从何而来呢?当然是来自于互联网啦。

在过去一两年的时间内,网络上的爬虫数量成倍增长、数不胜数,疯狂地在互联网上“搜刮”各种数据。

与此同时,随之而来的数据侵权和泄漏等等问题也引起了各内容厂商的强烈反感。

去年秋天,BBC 国家总监戴维斯说:“我们认为,这种未经允许就‘搜刮’BBC数据以训练大模型的做法不符合公众利益”,随后,他宣布BBC将封锁OpenAI的爬虫。

今年年初,路透社研究所发布了一项名为《有多少新闻网站会屏蔽人工智能爬虫》的研究。研究结果显示,截至 2023 年底,在全球 10 个国家的热门新闻网站中,近一半网站在robot.txt中屏蔽了 OpenAI 的爬虫 (48%) ,近四分之一屏蔽了谷歌的 AI 爬虫 (24%),这个数据能充分说明内容平台对AI爬虫的“深恶痛绝”。

但传统的用来防止BOT的Robots协议终究是一场“君子之约”,它只能防住表明自己身份的爬虫。在目光所不能及之处,还有许多黑灰产嗅到了数据变卖的利益,制造出更多爬虫在互联网的各个角落里阴暗爬行。他们用伪造UA、更换IP等等手段,就能够轻而易举地伪装自己,继续对数据“为所欲为”。

更有甚者,已经开始用AI和大模型来“加持”爬虫技术,让爬虫进化地更加灵活与智能。比如,传统的爬虫内容解析通常采用BS4等库,在面对复杂的页面结构时,编写XPath选择器就变得更加繁琐且容易出错;当页面结构变化时,也可能要重新编写选择器,让爬虫的使用变得非常复杂。但在大模型技术加持下,内容解析变得异常简单,大模型可以直接从网页源码中自动抽取标题和正文等信息,大大提升了内容解析的效率和准确性。

这样的爬虫,相当于从蜥蜴进化成了“哥斯拉”,从汽车变身成了变形金刚,让传统的BOT防御手段面临着更大的挑战。过去的一些策略已经不能抵挡来势汹汹的新生代爬虫大军,BOT防御措施急需一场有针对性的升级。

那么,到底有什么方法能够抵抗这些“变异升级”后的AI时代爬虫呢?

天空一声巨响

腾讯云WAF闪亮登场!

腾讯云WAF团队推出的BOT流量管理功能,集成了客户端风险识别(前端对抗)、防护规则集与领先的BOT-AI智能识别引擎这三重拦截能力,能够准确应对恶意机器人程序爬取带来的资源消耗、信息泄露及无效营销问题,同时也保障友好机器人程序的正常运行。

更牛的是:BOT流量管理深度融合了顶尖AI技术,将流量风控特征和黑灰产对抗经验转化为AI策略模型,打造出新一代智能化BOT流量管理体系,以AI之矛,攻BOT之盾(AI Anti BOT)!

相关内容

AI监管松绑!报道:美国放...
美国政府与人工智能公司Anthropic之间的监管对峙出现转机,但...
2026-06-27 08:55:32
字节与Anthropic打...
文 | 最话FunTalk,作者 | 林书,编辑 | 刘宇翔 6...
2026-06-26 22:40:47
在Soul App,他们一...
1980年,英国技术哲学家大卫·科林格里奇在 《技术的社会控制》中...
2026-06-26 22:39:24
AI抢电,戈壁造电
作者 | 辰纹 来源 | 洞见新研社 过去三年,全球AI 赛道的胜...
2026-06-26 22:38:15
曹操出行牵手上海人工智能研...
观点网讯:6月25日,曹操出行与上海人工智能研究院达成战略合作,正...
2026-06-26 18:44:30
SIGCOMM 2026 ...
论文作者均来自北京大学王选计算机研究所,第一作者为吴将凯博士,第二...
2026-06-26 18:43:57

热门资讯

2024云栖大会|阿里云升级无... 北京商报讯(记者魏蔚)9月20日,阿里云无影AI云电脑在2024云栖大会上展出,该版本基于最新的终端...
MWC2025荣耀多款AI技术... 人民财讯3月6日电,2025世界移动通信大会(MWC 2025)上,荣耀MagicBook Pro ...
原创 2... #春日生活好物种草季#近年来,笔记本电脑市场迎来技术爆发期,尤其在手机厂商跨界入局后,轻薄本在性能、...
摩尔线程发布AI算力笔记本MT... 钛媒体App 12月20日消息,摩尔线程创始人、董事长兼CEO张建中在摩尔线程首届MUSA开发者大会...
摩尔线程AI生图摩笔马良全新升... 快科技8月7日消息,作为国产GPU的杰出代表,摩尔线程在当下火爆的AIGC浪潮中也推出了自己的软硬一...
微软 Azure AI 语音服... IT之家 8 月 23 日消息,微软Azure AI 语音服务允许开发者构建多语言生成式 AI 语音...
谷歌打磨 Gemini AI ... IT之家 8 月 31 日消息,谷歌于 8 月 27 日发布博文,宣布旗下 Gemini AI 支持...
青云QingCloud Kub... 日前,青云科技宣布开源 Thanos 的企业级发行版 Whizard,为企业带来真正高可用、可扩展、...
Macos系统上一款强大的卸载... App Cleaner mac中文版是Mac os系统上一款强大 的mac卸载工具,以帮助您完全卸载...
AMD锐龙AI 9 HX 37... 2024年6月3日,AMD正式发布全新的锐龙AI 300系列处理器。该系列处理器一经发布就引发大家的...