美文网首页
C++ GBK编码 字符切割

C++ GBK编码 字符切割

作者: 李二007 | 来源:发表于2019-03-26 15:43 被阅读0次

    为了用C++简单实现bert模型地预处理,需要将中文字符串切割成单个中文汉字,网上没有找到在GBK编码下的C++版本,于是简单地查了下资料,实现了个半成品。

    GBK编码

    1. ASCII码
      使用一个字节(0-255)中的(0-127)来编码字符,(128-255)没用。
    2. GB2312码
      当一个字节的值在0-127之间时,该字节完整地表示了ASCII字符;
      当该字节的值在128-255之间时,继续读取下一个字节,用这两个字节的值(按某种规则计算)表示一个字符。
    3. GBK码
      GB2312只用了2个字节所能表达空间的一部分,微软继编码了另一部分得到GBK编码(主要包括ASCII,中文简体,中文繁体,日文)
    4. ANSI码
      微软在中国大陆采用GBK编码,而在台湾则采用Big5编码(台湾的GBK),微软对这种不同地区采用的不同编码方式统称为ANSI码(本地码)

    字符切割

    1. 判断第一个字节小于0,将该字节和下一个字节组成字符,该方法需要保证输入为合法的GBK字符。
    void GBKString2TokenList(const std::string& _input_str , std::vector< std::string >& token_list)
    {    
        const char* p = _input_str.c_str(); //游标
        const char * const start_idx = p; //固定初始位置
        unsigned int tmp_int = 0; //上一时刻,游标与固定初始位置的距离
        while (*p)  //字符串未结束
        {   
            if ((*p<0)&&(*(p+1)<0) //可简单当作中文等需要占据两个字节的字符
            {   
                p+=2;
            } 
            else // 英文数字等仅占一个字节的字符
            { 
                p++;
            }   
            token_list.push_back(_input_str.substr( tmp_int, p - start_idx - tmp_int)); //取上次游标距离到本次游标距离之间的字符
            tmp_int = p - start_idx; //更新上次游标距离
        }
        return;
    }
    
    1. 事实上GBK对双字节的区间规定更严格一些,如低字节在160-254之间,高字节在64-254之间等,有时间再研究下。

    参考

    1. https://xuexi.tutcw.com/js-bian-ma-ascii-gbk-utf/
    2. http://airtrack.me/posts/2012/12/23/%E5%AD%97%E7%AC%A6%E7%BC%96%E7%A0%81/
    3. https://www.jb51.net/article/36350.htm

    相关文章

      网友评论

          本文标题:C++ GBK编码 字符切割

          本文链接:https://www.haomeiwen.com/subject/zqmgvqtx.html