详解美团实现搜索关键词自动匹配功能的方法

问题背景
搜索关键字智能提示是一个搜索应用的标配,主要作用是避免用户输入错误的搜索词,并将用户引导到相应的关键词上,以提升用户搜索体验。

美团CRM系统中存在数以百万计的商家,为了让用户快速查找到目标商家,我们基于solrcloud实现了商家搜索模块。用户在查找商家时主要输入商户名、商户地址进行搜索,为了提升用户的搜索体验和输入效率,本文实现了一种基于solr前缀匹配查询关键字智能提示(Suggestion)实现。

需求分析
1.支持前缀匹配原则

在搜索框中输入“海底”,搜索框下面会以海底为前缀,展示“海底捞”、“海底捞火锅”、“海底世界”等等搜索词;输入“万达”,会提示“万达影城”、“万达广场”、“万达百货”等搜索词。
2.同时支持汉字、拼音输入
由于中文的特点,如果搜索自动提示可以支持拼音的话会给用户带来更大的方便,免得切换输入法。比如,输入“haidi”提示的关键字和输入“海底”提示的一样,输入“wanda”与输入“万达”提示的关键字一样。
3.支持多音字输入提示
比如输入“chongqing”或者“zhongqing”都能提示出“重庆火锅”、“重庆烤鱼”、“重庆小天鹅”。
4.支持拼音缩写输入
对于较长关键字,为了提高输入效率,有必要提供拼音缩写输入。比如输入“hd”应该能提示出“haidi”相似的关键字,输入“wd”也一样能提示出“万达”关键字。
基于用户的历史搜索行为,按照关键字热度进行排序
为了提供suggest关键字的准确度,最终查询结果,根据用户查询关键字的频率进行排序,如输入[重庆,chongqing,cq,zhongqing,zq] —> [“重庆火锅”(f1),“重庆烤鱼”(f2),“重庆小天鹅”(f3),…],查询频率f1 > f2 > f3。


解决方案
1.关键字收集

当用户输入一个前缀时,碰到提示的候选词很多的时候,如何取舍,哪些展示在前面,哪些展示在后面?这就是一个搜索热度的问题。用户在使用搜索引擎查找商家时,会输入大量的关键字,每一次输入就是对关键字的一次投票,那么关键字被输入的次数越多,它对应的查询就比较热门,所以需要把查询的关键字记录下来,并且统计出每个关键字的频率,方便提示结果按照频率排序。搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来,每个查询串的长度为1-255字节。
2.汉字转拼音
用户输入的关键字可能是汉字、数字,英文,拼音,特殊字符等等,由于需要实现拼音提示,我们需要把汉字转换成拼音,java中考虑使用pinyin4j组件实现转换。
3.拼音缩写提取
考虑到需要支持拼音缩写,汉字转换拼音的过程中,顺便提取出拼音缩写,如“chongqing”,"zhongqing"--->"cq",”zq”。
4.多音字全排列
要支持多音字提示,对查询串转换成拼音后,需要实现一个全排列组合,字符串多音字全排列算法如下:

Java Code复制内容到剪贴板

public static List getPermutationSentence(List> termArrays,int start) {   

  

  if (CollectionUtils.isEmpty(termArrays))   

      return Collections.emptyList();   

  

  int size = termArrays.size();   

  if (start < 0 || start >= size) {   

      return Collections.emptyList();   

  }   

  

  if (start == size-1) {   

      return termArrays.get(start);   

  }   

  

  List<String> strings = termArrays.get(start);   

  

  List<String> permutationSentences = getPermutationSentence(termArrays, start + 1);   

  

  if (CollectionUtils.isEmpty(strings)) {   

      return permutationSentences;   

  }   

  

  if (CollectionUtils.isEmpty(permutationSentences)) {   

      return strings;   

  }   

  

  List<String> result = new ArrayList<String>();   

  for (String pre : strings) {   

      for (String suffix : permutationSentences) {   

          result.add(pre+suffix);   

      }   

  }   

  

  return result;   

}  


上一篇:使用西部数码网站管理助手在Windows的服务器上建站的教程

下一篇:网站http服务器内部500错误的解决方法 [图文]

时间

2021-09-23 10:18


栏目

IT百科


文章推荐

  • SEM竞价应该如何分析受众?

    美好未来团队拥有超过10年的从业经验,是集网站建设、小程序开发、软件开发为一体的互联网企业...

  • 企业网站建设需要多长时间?

    美好未来团队拥有超过10年的从业经验,是集网站建设、小程序开发、软件开发为一体的互联网企业...

  • 站长赢利方法:先收录再考虑

    要说互联网上悠长的项目,原创公家号算一个,但别大意了网站,毕竟做了十年以上的草根站长,不...

  • 制作网站需要了解哪些知识?

    美好未来团队拥有超过10年的从业经验,是集网站建设、小程序开发、软件开发为一体的互联网企业...

  • 运营网站最正确的四个姿势

    创业很现实,运营网站也是如此,也许上线一个网站的初衷是一时“大脑发热”,跟风而上;也许是怀...