首页 >> 焦点 >> 爬虫去向何方?保护维基媒体基础设施的进展与下一步

爬虫去向何方?保护维基媒体基础设施的进展与下一步

发布时间:2026-10-09 01:33:04栏目:焦点

导读说明:原文发布于 2026-03-26。以下内容是依据原文重新组织、压缩并加入编辑性辨析的中文原创导读,不是逐句翻译,也不复制原图或原文长句。

免费知识并不等于免费基础设施

文章从一个常被忽略的矛盾出发:维基媒体内容允许自由再利用,但存储、带宽、API 和运维都有现实成本。生成式 AI 兴起后,自动抓取扩大到条目、媒体与开发者平台;与此同时,搜索摘要和聊天工具可能减少用户回到原站的机会。结果不是简单的“开放或封闭”之争,而是内容被更频繁抽取、来源可见度和回流却下降,基础设施压力也由公共知识社群承担。

把人和合规工具放在前面

维基媒体基金会的应对包括更新机器人政策、加强检测与防护、建设可统一管理的 API,并对不守规则的抓取请求实施限速或阻断。文章称,截至当时约 30% 的违规自动请求受到处理,量级最高可达每天数十亿次;图表所示未满足请求中,多数属于被拦截或限流的请求,约每天 15 亿次。这个比例是 2026 年 4 月 15 日由 25% 更新而来,应视作特定时点的运营数据,而不是长期不变的全站常数。

好机器人、坏机器人与伪装流量

难点在于自动化本身不是敌人。巡查、维护和内容生产同样依赖社群机器人,传统搜索爬虫也会标明身份、遇到错误后减速并带来访问者。新一代滥用者却可能伪装浏览器、绕过限流,甚至借“住宅代理”把请求混入普通家庭或移动网络。防护若过度,真人和公益工具会一起受伤;防护不足,公共资源又会被商业规模的抽取挤占。

从封堵走向可持续再利用

文章提出的方向包括继续改进识别、调整全球 API 限流、增强媒体基础设施,并建设归属标注 API,让再利用者更容易把读者带回知识来源。对运营者最有价值的启示,是把身份、速率和用途纳入分层治理:标识越充分,越容易获得更高额度;高容量需求应走专门通道。开放许可解决的是复制权利,却不会自动解决成本、署名、回流和公平使用,技术治理必须补上这些缺口。


来源与许可:原作者:Birgit Mueller, Wikimedia Foundation、Chris Danis, Wikimedia Foundation、Giuseppe Lavagetto, Wikimedia Foundation;原文:Quo Vadis, Crawlers? Progress and what’s next on safeguarding our infrastructure。本文对原文进行了重新组织、压缩、中文改写并加入编辑性辨析;未复制原图或原文长句。本文采用 CC BY-SA 4.0 许可并以相同许可共享;原文及媒体如有另行注明,以其注明为准。