Lazarus 1.8 Unicode 字符与UTF8字符的转换 - 代码天地

Lazarus 1.8 Unicode 字符与UTF8字符的转换

其他 2018-12-18 10:30:58 阅读次数: 0

Lazarus 1.8 Unicode 字符与UTF8字符的转换

我有一个文本文件，在WINDOWS 7 X64简体中文版中存储格式是UCS2,我想用LAZARUS 1.8 写一工具进行格式化，发现用MEMO1导入后显示乱码，经查，是LAZARUS 1.8 默认用UTF8处理字符，包括MEMO控件，所以需要转码，但测试了LAZutf8单元的工具都没有可用的，于是写下如下转码函数：

// UCS2格式文本转换为UTF8
// UCS2格式以两个字节UNICODE编码字符，所以只有保存码值为0XFFFF 之前的字符
// UCS2格式保存时，是低字先存，高字后存，如严字UNICODE编码为4E25,保存时先存25,再存4E
// C1,C2为UCS2文件中连续的两个字节

function UCS2ToUTF8(C1,C2:byte):UTF8string;
 var
   SH,SM,SL:Byte;
   VL,VH:Byte;
   V:Word;
 begin
   result:='';

   VL:=C1;  //25
   VH:=C2;  //4E
   V:=VH;
   V:=(V SHL 8)+VL;

   if (V>=$0000) AND (V<=$007F) then
      begin
         result:=Chr(VL);
      end
   else if (v>=$0080) and (v<=$07ff) then
      begin
         SM:=VL SHR 6;
         VL:=%10000000 +(%00111111 AND VL);
         VH:=%11000000 +(VH SHL 2)+SM;
         Result:=chr(VH)+CHR(VL);
      end
   else if (v>=$0800) and (v<=$FFFF) then
      begin
                 SL:=%10000000+(%00111111 AND VL);
                 SM:=%10000000+(VL SHR 6);
                 SM:=SM+((VH SHL 2) AND %00111100);
                 SH:=%11100000+(VH SHR 4);
                 Result:=chr(SH)+CHR(SM)+CHR(SL);
      end;
 end;

下面是检测文本文件格式的函数：
//检测文本文件编码格式

function  TextEncode(FileName:String):string;
var
  fs:TFileStream;
  flag:array[0..1] of byte;
begin
  flag[0]:=0;
  flag[1]:=0;
  fs:=TFileStream.Create(FileName,fmOpenRead);
  ALenth:=fs.Size;
  fs.read(flag,2);
  fs.Free;
  if (flag[0]=$EF) AND (flag[1]=$BB) then
     Result:='UTF-8'
  else if (flag[0]=$FE) AND (flag[1]=$FF) then
     Result:='BigEndianUnicode'
  else if (flag[0]=$FF) AND (flag[1]=$FE) then
     Result:='Unicode'
  else
    Result:='ANSI';
end;

转码原理参考文档：字符编码笔记阮一峰的博客文章

猜你喜欢

转载自blog.csdn.net/weixin_43754719/article/details/84964489

Lazarus 1.8 Unicode 字符与UTF8字符的转换

Ansi、Unicode、UTF8字符串之间的转换和写入文本文件

StringHelper完成字符编码转换Unicode UTF8 ANSI

utf8与unicode转换

Python编码UNICODE GBK UTF-8字符集转换的正确姿势

Unicode与UTF8

utf8 to unicode

js实现unicode码字符串与utf8字节数据互转

C++(19):字符转码UTF8/Unicode/Ascii

字符集原理GBK与UTF8与UNICODE

字符串编码之间的转换（GB2312<->UTF8<->Unicode）及URLEncoding

pb字符串实现GB2312与Unicode、UTF8之间的相互转换

unicode utf8编码

UniCode转UTF8

[整理]Unicode 与 UTF8

【编码】ASCII、Unicode、GBK和UTF-8字符编码的区别联系

ASCII，Unicode，GBK和UTF-8字符编码的区别和联系

ASCII、Unicode、GBK和UTF-8字符编码的区别联系

JAVA 编码之 ASCII、Unicode、GBK和UTF-8字符编码的区别联系

ASCII、Unicode、GBK和UTF-8字符编码的区别与联系

c++ uf8字符串与Unicode字符串之间转换

Lazarus 字符集转换 Utf8ToAnsi，UTF8ToWinCP，UTF8ToSys，UTF8ToConsole

js把2字节unicode编码转换成utf8编码

字符编码Unicode UTF-8 GBK的不同和转换

Unicode(utf8,utf16)

Unicode、UTF8、UTF16

qt unicode、gbk、utf8之间转换

ASCII Unicode, UTF8 的关系,string和wstring转换

【字符编码】简洁理解ANSI,UTF8,Unicode,ASCII编码的差别

Unicode,UTF-8,ASCII等字符编码

今日推荐

手把手教你用 LangChain 实现大模型 Agent

外星人入侵（python）

超全的免费chatGPT列表【建议收藏】

52.2k star! 自己部署gpt4free, 免费使用各种GPT

2024年（第十届）全国大学生统计建模大赛优秀论文解析——中国经济发展与碳排放库兹涅茨曲线的验证研究

【自动驾驶技术】自动驾驶汽车AI芯片汇总——NVIDIA篇

7个免费的ChatGPT网站，给大家送上

Angular v18 正式发布！

【VMware】 vCenter Converter standalone 6.6.0正式版下载

开源日报 | Angular v18；大模型价格战下的推理优化；Mistral AI以开源模型瞄准美国市场；硅谷有自己的鲁迅

数学建模Matlab之数据预处理方法

充电桩---ISO15118协议详细介绍

周排行

慧测学习课件

Mscordacwks.dll/SOS.dll 调试归档

关于深度学习人工智能模型的探讨（二）（7）

Stop Using the text-indent:-9999px

Least Common Multiple（HDU - 1019 ）

Comparator接口的使用方法--例子

修改framework Camera的API,旋转摄像头

机器学习时代的“大数据+”：数据平台的设计与搭建

vue 项目部署到nginx

webstorm 常用插件集合

每日归档

更多

2024-05-29(65)

2024-05-28(2)

2024-05-27(56)

2024-05-26(6)

2024-05-25(68)

2024-05-24(65)

2024-05-23(9)

2024-05-22(41)

2024-05-21(8)

2024-05-20(36)