导读说明:原文发布于 2026-06-11。以下内容是依据原文重新组织、压缩并加入编辑性辨析的中文原创导读,不是逐句翻译,也不复制原图或原文长句。
搜索失败不一定是拼错了
同一位用户在拉丁字母、西里尔字母或本族文字之间切换时,可能用错键盘布局,也可能知道一个词的读音,却无法输入对应文字。原文举例称,俄语维基百科的全文检索中,疑似“错键盘”查询最高可占约1%;这是作者长期观察所得,并非所有语言的通用比例。俄语和希伯来语社群过去曾用名为 DWIM 的小工具补救,但界面库变化使依赖的 JavaScript 接口失效。搜索团队随后把补救逻辑移到搜索后端,在正常自动补全不足时再做一次字符映射并补充候选。
同一套框架处理两类障碍
后端方案先服务俄语和希伯来语的键盘映射,又扩展到格鲁吉亚语的拉丁、西里尔字母转写,以及印地语的拉丁化输入。它解决的不是“把英语翻译成本族语”,而是识别用户用另一套字符写出的同一种语言。格鲁吉亚语的非正式转写会混用大小写和多字母组合;印地语的映射更是多对多。为保证每次按键后的响应速度,团队没有调用高成本模型,而采用重写规则、统计倾向及约1400个常见词的直接映射。
数字显示价值,也暴露输入门槛
文章给出的样本中,印地语维基百科约60.1%的自动补全点击、16.3%的搜索框全部点击来自二次转写建议,明显高于其他试点。这个比例不能理解为全部搜索成功率:只有普通候选未占满且映射能返回结果时,二次建议才会出现,小型项目也因数据稀疏被排除。高使用率既说明功能有效,也可能反映天城文输入本身仍有较高门槛。
尚未解决的是完整搜索
目前改进主要限于输入时建议;用户直接提交错键盘或转写查询,全文搜索仍可能失败。把方案扩展为“您是不是要找”还要处理荒谬纠错、零结果过滤、计算成本和不同语言的候选排序。对中文项目的启示不是立即照搬,而是先检查拼音、繁简体、键盘残留等真实无结果查询,再用小规模实验验证。输入包容性应以实际行为为依据,不能只按标准转写规则设计。
来源与许可:原作者:Trey Jones(Search Platform Team, Wikimedia Foundation);原文:Do What I Mean! Second-Try Suggestions for Wrong-Keyboard and Transliterated Search。本文对原文进行了重新组织、压缩、中文改写并加入编辑性辨析;未复制原图或原文长句。本文采用 CC BY-SA 4.0 许可并以相同许可共享;原文及媒体如有另行注明,以其注明为准。