-
PHP改进计算字符串相似度的函数similar_text()、levenshtein()
PHP 原生的similar_text()函数、levenshtein()函数对中文汉字支持不好,我自己写了一个,测试使用正常,推荐给大家,如果有什么问题,请留言
similar_text()中文汉字版,代码如下:
- <?php
- //拆分字符串
- function split_str($str) {
- preg_match_all("/./u", $str, $arr);
- return $arr[0];
- }
- //相似度检测
- function similar_text_cn($str1, $str2) {
- $arr_1 = array_unique(split_str($str1));
- $arr_2 = array_unique(split_str($str2));
- $similarity = count($arr_2) - count(array_diff($arr_2, $arr_1));
- return $similarity;
- }
levenshtein()中文汉字版,代码如下:
- <?php
- //拆分字符串
- function mbStringToArray($string, $encoding = 'UTF-8') {
- $arrayResult = array();
- while ($iLen = mb_strlen($string, $encoding)) {
- array_push($arrayResult, mb_substr($string, 0, 1, $encoding));
- $string = mb_substr($string, 1, $iLen, $encoding);
- }
- return $arrayResult;
- }
- //编辑距离
- function levenshtein_cn($str1, $str2, $costReplace = 1, $encoding = 'UTF-8') {
- $count_same_letter = 0;
- $d = array();
- $mb_len1 = mb_strlen($str1, $encoding);
- $mb_len2 = mb_strlen($str2, $encoding);
- $mb_str1 = mbStringToArray($str1, $encoding);
- $mb_str2 = mbStringToArray($str2, $encoding);
- for ($i1 = 0; $i1 <= $mb_len1; $i1++) {
- $d[$i1] = array();
- $d[$i1][0] = $i1;
- }
- for ($i2 = 0; $i2 <= $mb_len2; $i2++) {
- $d[0][$i2] = $i2;
- }
- for ($i1 = 1; $i1 <= $mb_len1; $i1++) {
- for ($i2 = 1; $i2 <= $mb_len2; $i2++) {
- // $cost = ($str1[$i1 - 1] == $str2[$i2 - 1]) ? 0 : 1;
- if ($mb_str1[$i1 - 1] === $mb_str2[$i2 - 1]) {
- $cost = 0;
- $count_same_letter++;
- } else {
- $cost = $costReplace; //替换
- }
- $d[$i1][$i2] = min($d[$i1 - 1][$i2] + 1, //插入
- $d[$i1][$i2 - 1] + 1, //删除
- $d[$i1 - 1][$i2 - 1] + $cost);
- }
- } //www.phpfensi.com
- return $d[$mb_len1][$mb_len2];
- //return array('distance' => $d[$mb_len1][$mb_len2], 'count_same_letter' => $count_same_letter);
- }
最长公共子序列LCS(),代码如下:
- <?php
- //最长公共子序列英文版
- function LCS_en($str_1, $str_2) {
- $len_1 = strlen($str_1);
- $len_2 = strlen($str_2);
- $len = $len_1 > $len_2 ? $len_1 : $len_2;
- $dp = array();
- for ($i = 0; $i <= $len; $i++) {
- $dp[$i] = array();
- $dp[$i][0] = 0;
- $dp[0][$i] = 0;
- }
- for ($i = 1; $i <= $len_1; $i++) {
- for ($j = 1; $j <= $len_2; $j++) {
- if ($str_1[$i - 1] == $str_2[$j - 1]) {
- $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;
- } else {
- $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];
- }
- }
- }
- return $dp[$len_1][$len_2];
- }
- //拆分字符串
- function mbStringToArray($string, $encoding = 'UTF-8') {
- $arrayResult = array();
- while ($iLen = mb_strlen($string, $encoding)) {
- array_push($arrayResult, mb_substr($string, 0, 1, $encoding));
- $string = mb_substr($string, 1, $iLen, $encoding);
- }
- return $arrayResult;
- }
- //最长公共子序列中文版
- function LCS_cn($str1, $str2, $encoding = 'UTF-8') {
- $mb_len1 = mb_strlen($str1, $encoding);
- $mb_len2 = mb_strlen($str2, $encoding);
- $mb_str1 = mbStringToArray($str1, $encoding);
- $mb_str2 = mbStringToArray($str2, $encoding);
- $len = $mb_len1 > $mb_len2 ? $mb_len1 : $mb_len2;
- $dp = array();
- for ($i = 0; $i <= $len; $i++) {
- $dp[$i] = array();
- $dp[$i][0] = 0;
- $dp[0][$i] = 0;
- }
- for ($i = 1; $i <= $mb_len1; $i++) {
- for ($j = 1; $j <= $mb_len2; $j++) {
- if ($mb_str1[$i - 1] == $mb_str2[$j - 1]) {
- $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;
- } else {
- $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];
- }
- }
- }
- return $dp[$mb_len1][$mb_len2];
- }
出处:http://www.phpfensi.com/php/20210418/14377.html
栏目列表
最新更新
nodejs爬虫
Python正则表达式完全指南
爬取豆瓣Top250图书数据
shp 地图文件批量添加字段
爬虫小试牛刀(爬取学校通知公告)
【python基础】函数-初识函数
【python基础】函数-返回值
HTTP请求:requests模块基础使用必知必会
Python初学者友好丨详解参数传递类型
如何有效管理爬虫流量?
SQL SERVER中递归
2个场景实例讲解GaussDB(DWS)基表统计信息估
常用的 SQL Server 关键字及其含义
动手分析SQL Server中的事务中使用的锁
openGauss内核分析:SQL by pass & 经典执行
一招教你如何高效批量导入与更新数据
天天写SQL,这些神奇的特性你知道吗?
openGauss内核分析:执行计划生成
[IM002]Navicat ODBC驱动器管理器 未发现数据
初入Sql Server 之 存储过程的简单使用
这是目前我见过最好的跨域解决方案!
减少回流与重绘
减少回流与重绘
如何使用KrpanoToolJS在浏览器切图
performance.now() 与 Date.now() 对比
一款纯 JS 实现的轻量化图片编辑器
关于开发 VS Code 插件遇到的 workbench.scm.
前端设计模式——观察者模式
前端设计模式——中介者模式
创建型-原型模式