使用pandas模糊匹配两个DataFrame的两列,报错
import re
import pandas as pd
df1 = pd.read_excel(r'/Users/Minute/Desktop/XX工作/XXXX品牌标签.xlsx')
df2 = pd.read_excel(r'/Users/Minute/Desktop/XX工作/XXXX全量商户V2.xlsx')
# print(df1.head(), df2.head())
'''
df1 index brand
0 1 皇冠假日
1 2 假日
2 3 智选假日
3 4 洲际
4 5 华邑
----------------------------------------
df2 mid NAMES
0 1 长沙华雅国际大酒店
1 2 湖南金龙玉凤集团澧县桃花滩宾馆有限公司
2 3 舟山市新锦港宾馆有限公司
3 4 普瑞酒店
4 5 南京金陵之星大酒店有限责任公司
'''
dict_keys = {row.index: row.brand for row in df1.itertuples()}
# print(type(dict_keys), dict_keys)
'''
class 'dict'>
{1: '皇冠假日', 2: '假日', 3: '智选假日', 4: '洲际',
5: '华邑', 6: '喜来登', 7: '万豪', 8: '万怡', 9: '威斯汀',
10: '万丽', 11: '福朋', 12: 'JW 万豪', 13: '丽思卡尔顿'}
'''
def merge_func(row):
row['key_ids'] = [keyid
for key_word, keyid in dict_keys.items()
if re.search(key_word, row['NAMES'], re.IGNORECASE)]
return row
df_merge = df2.apply(merge_func, axis=1)
'''
TypeError: first argument must be string or compiled pattern
'''
TypeError: first argument must be string or compiled pattern
修改colunm的标签、修改Python文件名后都报此错。但是使用win电脑执行命令就不报错。
可执行def merge_func(row)函数