现在有文本,按字节定长文件,gbk或者UTF8或者unicode编码都有可能包含敏感信息需要变形,变形规则如下,如果是中文和数字及字母,按已经定义好的对照表替换,如果是外文,则奇数位不变,偶数位统一换成字母A。本想按字节截取字段后转为string,然后逐个字符判断ascii码是否落在中文和英文字母及数字的区间判断。但又想既然都已经read 到byte了,转为字符又转ascii 似乎太绕了,但不同字符占的字节不同,直接根据byte怎么判断当前的byte 是属于中文还是外文呢还是英文和数字呢
现在有文本,按字节定长文件,gbk或者UTF8或者unicode编码都有可能包含敏感信息需要变形,变形规则如下,如果是中文和数字及字母,按已经定义好的对照表替换,如果是外文,则奇数位不变,偶数位统一换成字母A。本想按字节截取字段后转为string,然后逐个字符判断ascii码是否落在中文和英文字母及数字的区间判断。但又想既然都已经read 到byte了,转为字符又转ascii 似乎太绕了,但不同字符占的字节不同,直接根据byte怎么判断当前的byte 是属于中文还是外文呢还是英文和数字呢