近日,一项旨在规范大语言模型(LLM)抓取网页内容的提议标准——`llms.txt`引发技术社区关注。该标准提议网站在根目录放置一个纯文本文件,用于向AI爬虫提供站点内容的结构化摘要或抓取指南,以期解决大模型在处理长网页时上下文丢失及抓取效率低下的问题。然而,尽管该提议在开发者和SEO专家中获得了一定讨论,但目前的调查数据显示,包括OpenAI、Anthropic及谷歌在内的主流AI平台均未正式确认将支持或采用这一标准。行业观察认为,这一现状反映了AI生态中缺乏统一数据协议的困境,平台方更倾向于依赖自有的封闭式抓取策略,而非采用第三方的开放协议。
事件分析
核心观点:主流平台的集体沉默折射出AI数据抓取正走向封闭生态,缺乏巨头背书的开放标准难以打破现有的数据壁垒。
原文链接:Hacker News

评论前必须登录!
立即登录 注册