zhangqiyi 2012-07-05 15:09
浏览 307
已采纳

大数量数据进行聚类排重讨论

在项目开发中,用户需要在数据库导入大量在线商户信息,但是由于每个商户信息是通过外包采集员进行采集,所以存在商户信息重复的问题。所以,用户要求到导入EXCEL文件时操作时,先判断数据库中是否存在和EXCEL文件相似记录,如果有相似记录需要把正式信息和导入信息合并到一个文件中,用户导出进行修改。

相似数据实例如下:

名称 地址

北京视频影像公司 北京市朝阳区八里桥221号

视频影像公司 北京市朝阳区八里桥221号

北京视频影像公司人力资源部 北京市八里桥221号

请大家讨论如何解决。现在系统对数据库做了搜索索引,可以进行搜索。

  • 写回答

3条回答 默认 最新

  • cutxyz 2012-07-05 18:24
    关注

    8) 要看你们打算以名称相似排序还是地址相似排了,当然也可以两个同时排,方法可以使用类似百度谷歌输入关键字提示的方法差不多,简单的说可以用三叉树做个相近字符搜索,当然具体哪些是一样的还是需要人来判断,机器最多将相似度较高的放一起,好让人来作选择。

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

悬赏问题

  • ¥20 有人能用聚类分析帮我分析一下文本内容嘛
  • ¥15 请问Lammps做复合材料拉伸模拟,应力应变曲线问题
  • ¥30 python代码,帮调试
  • ¥15 #MATLAB仿真#车辆换道路径规划
  • ¥15 java 操作 elasticsearch 8.1 实现 索引的重建
  • ¥15 数据可视化Python
  • ¥15 要给毕业设计添加扫码登录的功能!!有偿
  • ¥15 kafka 分区副本增加会导致消息丢失或者不可用吗?
  • ¥15 微信公众号自制会员卡没有收款渠道啊
  • ¥100 Jenkins自动化部署—悬赏100元