【想法探讨】讨论是否可行--使用“文本内容(现代汉语)→文言文”转换极致压缩上下文输入
Author: KunIsMeCreated Oct 24, 2025Updated Apr 2, 2026
问题描述: 希望探索一种通过 现代汉语→文言文转换 的方式来实现极致压缩,在保证语义不变的前提下大幅减少 tokens 使用量。
背景: (1)文言文具有极高的信息密度,相同内容比现代汉语字符数少 50-70%; (2)在 AI 模型中,更少的 tokens 意味着“更低的计算成本”、“更快的处理速度”、“能够处理更长的上下文”。
预期方案: (1)开发现代汉语到文言文的转换模块(训练专用的文本压缩模型、建立现代汉语与文言文的对应词典、设计语义保持机制); (2)在 Agent 流程中集成; (3)压缩效果目标(tokens 减少 60% 以上、语义保持率 >95%、可逆转换)。
潜在挑战: (1)文言文的歧义性问题; (2)专业术语的准确转换; (3)实时转换的性能要求。
欢迎大家多多讨论~目前上方内容还仅是我的一种设想,期待大家一起脑暴!!
Source: deepseek-ai/DeepSeek-OCR