C++ GBK编码字符切割

作者: 李二007 | 来源:发表于2019-03-26 15:43 被阅读0次

C++ GBK编码字符切割
iOS之GBK编码_知道的轻车熟路不知道的翻山越岭
错误: 编码GBK的不可映射字符
Android Studio 出现：编码GBK的不可映射字符的
5.MySQL字符集和权限安全
C++ Builder 的字符串类型、字符类型、字符编码
字符编码和字符集ASCII，Unicode，UTF-8，UTF-
CMD命令提示符改编编码命令
Ubuntu中使用windows文件名乱码问题
javaDoc文档问题

为了用C++简单实现bert模型地预处理，需要将中文字符串切割成单个中文汉字，网上没有找到在GBK编码下的C++版本，于是简单地查了下资料，实现了个半成品。

GBK编码

ASCII码
使用一个字节（0-255）中的（0-127）来编码字符，（128-255）没用。
GB2312码
当一个字节的值在0-127之间时，该字节完整地表示了ASCII字符；
当该字节的值在128-255之间时，继续读取下一个字节，用这两个字节的值(按某种规则计算)表示一个字符。
GBK码
GB2312只用了2个字节所能表达空间的一部分，微软继编码了另一部分得到GBK编码（主要包括ASCII,中文简体，中文繁体，日文）
ANSI码
微软在中国大陆采用GBK编码，而在台湾则采用Big5编码(台湾的GBK),微软对这种不同地区采用的不同编码方式统称为ANSI码(本地码)

字符切割

判断第一个字节小于0，将该字节和下一个字节组成字符，该方法需要保证输入为合法的GBK字符。

void GBKString2TokenList(const std::string& _input_str , std::vector< std::string >& token_list)
{    
    const char* p = _input_str.c_str(); //游标
    const char * const start_idx = p; //固定初始位置
    unsigned int tmp_int = 0; //上一时刻，游标与固定初始位置的距离
    while (*p)  //字符串未结束
    {   
        if ((*p<0)&&(*(p+1)<0) //可简单当作中文等需要占据两个字节的字符
        {   
            p+=2;
        } 
        else // 英文数字等仅占一个字节的字符
        { 
            p++;
        }   
        token_list.push_back(_input_str.substr( tmp_int, p - start_idx - tmp_int)); //取上次游标距离到本次游标距离之间的字符
        tmp_int = p - start_idx; //更新上次游标距离
    }
    return;
}