Surge AI 博客评估了 2022 年 Google 的搜索结果页(SERP)质量。这篇文章主要是对比了 Bing 的SERP,Google 在消歧义和广告滥用上还有些差距。此时我觉得这篇文章更像是——2022 年了,看看其他搜索引擎跟没跟得上 Google 的步伐。而答案是跟得上并且显得 Google 有些「不思进取」。
Surge AI 博客评估了 2022 年 Google 的搜索结果页(SERP)质量。这篇文章主要是对比了 Bing 的SERP,Google 在消歧义和广告滥用上还有些差距。此时我觉得这篇文章更像是——2022 年了,看看其他搜索引擎跟没跟得上 Google 的步伐。而答案是跟得上并且显得 Google 有些「不思进取」。
文章强调理想 SERP 应直接展示答案而非仅提供链接,如估值信息直接出现在顶部。评测者对 Google 和 Bing 的 SERP 进行 1-5 分评分及并排对比,分析查询意图满足程度。文中多个失败案例显示 SERP 误解查询或信息排序不当,导致用户体验下降。
本文核心方法,指通过人工评测者对真实用户搜索查询及其意图进行打分,以衡量搜索引擎质量。作者招募250名评测者回顾自身浏览器历史查询,在1-5分量表上评估Google SERP是否满足意图,并解释判断理由。该方法被用来克服点击率、停留时长等传统指标的局限,直接捕捉搜索结果的相关性与有用性。
文中指出长期A/B测试虽可通过用户留存等指标评估搜索质量,但迭代速度慢且难以快速验证改进效果。因此作者转而采用人工评测作为更灵活的替代方案,用于快速比较Google与Bing等引擎在同一查询上的表现差异。
本文作者利用 Surge AI 平台招募高技能评测者完成搜索质量人工评估任务。该平台专注高质量数据标注,曾支持 OpenAI 等项目。作者曾在 YouTube、Twitter、Microsoft 负责搜索测量,现通过 Surge AI 提供搜索评测服务,用于分析 Google 与 Bing 的 SERP 表现。
本文相关链接提到 Surge AI 为 OpenAI 构建了包含 8500 道数学问题的 GSM8K 数据集,展示其在教育类 AI 任务上提供高质量标注数据的专长。
本文通过相关文章链接指出 Anthropic 借助 Surge AI 进行 RLHF 训练 Claude,强调人类反馈在提升模型质量中的作用,与搜索质量评估中的人工打分逻辑一致。
本文通过 Surge AI 的 250 名高技能评测者进行人工评估,测试 2022 年 Google Search 质量。评测者使用自身真实历史查询,Google 整体得分高于 Bing,但存在理解偏差问题,如“databricks series b valuation”首条结果不相关、“tim lee vlogger age”无法找到年龄信息。文章指出点击率等传统指标难以衡量搜索质量,建议采用人工判断 SERP 是否满足用户意图。
页面底部相关博文将 LMArena 描述为 AI 领域的负面现象,暗示其评估方式存在问题,与本文提倡严谨人类评估形成对比。
文章通过并排对比评估发现,Bing 在部分查询上优于 Google,例如“Natural ways to heal cats who have allergies”提供针对性文章与产品,“what is message blocking on iphone”准确理解意图,“Indianapolis free COVID PCR tests”直接展示地图资源。整体统计上 Google 仍胜出,但 Bing 在理解查询和呈现实用信息方面有时更优。
本文作者 Edwin Chen 曾任职于 YouTube、Twitter、Microsoft 的搜索测量团队,熟悉搜索质量评估方法。他通过 Surge AI 平台组织 250 名评测者,使用真实历史查询对 Google Search 进行 1-5 分评分及 Bing 并排对比,得出 Google 整体领先但存在明显缺陷的结论。
本文未对ChatGPT进行讨论或评测,仅在页面底部相关文章列表中出现链接,指向另一篇使用人工评测比较ChatGPT与Google搜索的文章。
本文未涉及Claude,仅在站点导航的相关文章区出现指向Anthropic使用Surge AI训练Claude的外部链接,与本篇Google搜索评测主题无关。
文章开篇提及Hacker News上近期存在大量讨论,质疑Google搜索质量近年是否下降。作者以此为背景,结合自身观察(如Databricks系列B估值查询案例),通过人工评测数据验证这一现象,并分析可能原因。
正文末尾预告后续将使用相同人工评测方法,对比Google与DuckDuckGo的搜索表现,作为寻找Google搜索缺陷模式、探讨竞品机会的一部分内容。
文章以“databricks series b valuation”搜索为例,说明 Google Search 无法正确理解“series b”含义,导致首条结果不相关且信息位置靠后。相比之下 Bing 能将 Series B 信息置于首条展开结果中,侧边栏也更实用。该案例被用来展示 Google 可能因短期广告优先或 ML 使用不当而导致质量下降。
本文作者利用 Surge AI 平台招募高技能评测者完成搜索质量人工评估任务。该平台专注高质量数据标注,曾支持 OpenAI 等项目。作者曾在 YouTube、Twitter、Microsoft 负责搜索测量,现通过 Surge AI 提供搜索评测服务,用于分析 Google 与 Bing 的 SERP 表现。
文章底部链接指出 Neeva 采用人类评估来衡量搜索质量,与本文核心方法相同,旨在挑战 Google 的搜索表现。
本文底部相关文章提及 Surge AI 为 OpenAI 构建了 GSM8K 数学问题数据集,体现了 Surge 在高质量数据标注上的能力,与文中强调的人类评估方法一致。
文章列出的相关内容显示 Anthropic 使用 Surge AI 平台训练和评估 Claude,采用人类反馈进行 RLHF,这与本文推崇的人类评估搜索质量的方法相呼应。
可左右滑动查看