yca2220206 2014-06-12 03:13 采纳率: 0%
浏览 2185

集思广益,有个几百万关键字的文本匹配的算法,大家进来看看

关键字 都是放在一个数组中的,譬如$keyword_arr=["key1","key2","example",......],大约有几百万甚至上千万的关键字,这些关键字已经按照优先级从前到后排列了,越靠前的关键字优先匹配,匹配的最多次数是$max次;目前采用for循环$keyword_arr数组,然后将关键字组装成'/\b(?:'.$value.')\b/i';正则来匹配文本内容$text;如果已经匹配了$max次了,就停止匹配。

这个算法肯定是最低效的,大家有好的建议可以提出来,主要问题是关键字优先级有点麻烦

php: 目前采用正则匹配:

        foreach ($keyword_arr as $key=>$value) {
            $pattern = '/\\b(?:'.$value.')\\b/i';
            preg_match($pattern, $text, $match, PREG_OFFSET_CAPTURE);
            if ($match && trim($match[0][0]) != '' && !in_array(strtolower($match[0][0]), $match_keyword_arr)) {
                $match_keyword_arr[] = strtolower($match[0][0]);
                $count ++;
                if ($count >= $max) {
                    break;
                }
        }
  • 写回答

1条回答 默认 最新

  • kevin_Luan 2014-06-15 10:35
    关注

    类似这种处理不建议正则,大量使用正则会消耗很高的CPU。
    优化方法:
    建议使用状态机的方式实现。其实你的需求简单理解为通过一批关键字匹配关键字然后处理后续的业务等。

    我之前处理相似的业务
    1. 写了一个StringToken处理类
    http://blog.csdn.net/kevin_luan/article/details/26875341
    2. 敏感词过滤
    http://download.csdn.net/detail/kevin_luan/7322435

    我使用JAVA写的,不过PHP同样可以实现相似的业务,希望对你有所启发。

    评论

报告相同问题?

悬赏问题

  • ¥15 请教:如何用postman调用本地虚拟机区块链接上的合约?
  • ¥15 为什么使用javacv转封装rtsp为rtmp时出现如下问题:[h264 @ 000000004faf7500]no frame?
  • ¥15 乘性高斯噪声在深度学习网络中的应用
  • ¥15 运筹学排序问题中的在线排序
  • ¥15 关于docker部署flink集成hadoop的yarn,请教个问题 flink启动yarn-session.sh连不上hadoop,这个整了好几天一直不行,求帮忙看一下怎么解决
  • ¥15 深度学习根据CNN网络模型,搭建BP模型并训练MNIST数据集
  • ¥15 C++ 头文件/宏冲突问题解决
  • ¥15 用comsol模拟大气湍流通过底部加热(温度不同)的腔体
  • ¥50 安卓adb backup备份子用户应用数据失败
  • ¥20 有人能用聚类分析帮我分析一下文本内容嘛