始终保留一份未修改的原文件。反复保存乱码文本,可能造成无法恢复的字符丢失。
文本文件保存的是字节,编码规则决定编辑器如何把字节还原成文字。用错误编码读取文件时,可能看到无意义字符或 � 这样的替换符号。
EpuBloom 如何读取 TXT?
- 文件存在字节顺序标记(BOM)时,识别 UTF-8、UTF-16LE 和 UTF-16BE。
- 没有 BOM 时,先检查字节是否为有效的 UTF-8。
- UTF-8 校验失败时尝试 GBK,一些较早的中文 TXT 文件采用这种编码。
这是按顺序尝试的处理方式,不能保证识别所有编码。其他历史编码,以及不带 BOM 的 UTF-16 文件,可能需要先用编辑器正确打开并另存。
保存一份可读的 UTF-8 副本
- 用支持指定读取编码的文本编辑器打开原始 TXT。
- 如果乱码,重新打开未修改的原文件,尝试来源对应的编码。较早的中文文件可能使用 GBK;如果知道来源软件的编码设置,以实际来源为准。
- 检查多个段落、标点和章节标题,确保文字可正常阅读后再保存。
- 使用“另存为”或编辑器的编码设置,保存一份新的 UTF-8 文件。
- 在转换器中选择新文件,生成 EPUB,再用阅读器检查。
“重新打开”和“转换编码”不同
使用指定编码重新打开,是换一种规则解释原始字节;另存为 UTF-8,则把编辑器当前显示的字符写入新文件。如果当前显示已经乱码,直接保存为 UTF-8 可能把乱码固定下来,而不是修复它。
如果唯一副本中的字符已经丢失,或被保存成替换符号,切换编码也无法可靠还原。请查找备份,或重新获取原始文件。
文字正常,但电子书效果不对?
如果字符正确、目录缺少章节,请检查章节标题格式。如果从 EPUB 提取文字后丢失图片或表格排版,这是纯文本格式的限制,不一定是编码错误。
需要帮助时,通过联系渠道说明来源编码、浏览器和可见错误。可公开的简短示例比完整的私人稿件更合适。