mewlconverter v3.4.3 转换「微软拼音自学习词库」后无法导入(提示文件损坏),疑为格式处理回归
Author: In233Created Sep 14, 2026Updated Sep 14, 2026
环境
| 项目 | 版本 / 说明 |
|---|---|
| imewlconverter | v3.4.3(对照版本 v3.4.0,同一台机器、同一份源文件) |
| 操作系统 | Windows 11 24H2,内部版本 26100.9445,64 位 |
问题描述
v3.4.3 转换生成的「微软拼音(Win10 自学习词库)」文件,导入微软拼音时报:
失败:文件格式错误或文件已损坏
v3.4.0 用同样的源文件、同样的目标格式,可以正常导入。
复现步骤
- 打开 imewlconverter,载入源词库文件;
- 目标格式选择「微软拼音(Win10 自学习词库)」;
- 源文件解析方式分别使用 内置格式转换 与 自定义词库编码(默认配置),各转换一次;
- 在微软拼音「词库和自学习 → 自学习词库 → 导入」中导入生成的文件 → 失败。
现象对比
| 版本 | 源文件解析方式 | 转换后词条形态 | 导入结果 |
|---|---|---|---|
| v3.4.3 | 自定义(默认) | 测试,ce shi ,1 |
❌ 文件格式错误或已损坏 |
| v3.4.0 | 内置格式转换 | 测试,ce,shi 测试 1 |
✅ 正常导入 |
| v3.4.0 | 自定义(默认) | 测试,ce,shi 测试 1 |
✅ 正常导入 |
分析
两个版本产出的词条形态不同:
- v3.4.0:
测试,ce,shi 测试 1—— 呈现为「编码,编码,编码␣␣词条␣词频」的多段结构; - v3.4.3:
测试,ce shi ,1—— 形态上像是源文件行被原样透传(仍是「词语,拼音,词频」的排列,拼音音节之间保留空格,逗号前还多一个空格),没有转换成目标词库所需的记录结构。生成的文件结构因此不合法,导入端判定为"格式错误或已损坏"。
- v3.4.0:
自定义配置疑似不生效:在 v3.4.3 的「自定义词库编码」中手动调整过词条排序、分隔符、词频等选项,输出形态没有任何变化,生成的文件依旧无法导入。
Source: studyzy/imewlconverter