rangeOfComposedCharacterSequence

作者: 一代骄马 | 来源:发表于2018-05-06 13:33 被阅读395次

rangeOfComposedCharacterSequence

ios 开发 NSString 正确遍历字符个数方式 (surrogate pairs) - CSDN博客

最近在处理Cocoa NSString时, 遇到一些字符编码的问题, 从而引出一个遍历NSString每一个字符的”正确”方式! 很有趣.

NSString是UTF-16编码的, 也就是16位的unichar字符的序列. 所以, 一般遍历其每一个字符的方法就是:

for(int i=0; i

unichar ch = [str characterAtIndex: i];

}

但是, 我们平常书写的字符, 并不全部都是用唯一的一个16位字符来表示, 而是有一部分用两个16位字符来表示, 这就是surrogate pairs的概念. 如果还是用上面的方法遍历字符串, 就会出现”断字”. 例如图中这个Apple Color Emoji的”THUMBS UP SIGN”字符, 其实是用2个16位unichar来表示, 它的Unicode是U+1F44D, 用(U+D83D U+DC4D)两个字符来表示.

还好, NSString的rangeOfComposedCharacterSequencesForRange:和rangeOfComposedCharacterSequenceAtIndex:两个方法可以用来处理这种情况. 所以, 真正正确的遍历NSString的每一个字符的方法就是这样了:

NSString*str =@"🐎";

NSRange range;

for(int i=0; i<str.length; i+=range.length){

range = [str rangeOfComposedCharacterSequenceAtIndex:i];

NSString*s= [str substringToIndex:range.location];

}

一次遍历一个子串, 而不是遍历一个unichar了.

网友评论

本文标题：rangeOfComposedCharacterSequence

本文链接：https://www.haomeiwen.com/subject/eicurftx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

rangeOfComposedCharacterSequence

相关文章