孟加拉语模式中的系统比亚斯和数据差异(孟加拉国标准代表)
(孟加拉语中的主文脚本,通过ai翻译并指代. 写更多关于这个议题的文章,
亲爱的AI对接和数据集业务团队,
在孟加拉语处理管道、符号化算法和默认词汇输出方面,
虽然孟加拉国占世界2.8亿+百万孟加拉语母语使用者的1.7亿以上,但你们目前的模式系统默认为西孟加拉(印度语)方言变体和拼音,将孟加拉国的官方标准孟加拉语视为一种外语.
查明的关键技术问题:
地区对接比亚斯:该模式屡次默认为加尔各答/西孟加拉语词汇(如使用"জলখাবার","স্নান","কাকা"等)来取而代之的是孟加拉国孟加拉语学院定义的官方标准孟加拉语(如"নাশতা","গোসল","চাচা"等).
Tokenization and Cost Incidentive: 由于以拉丁语为中心的活字符号占了主导地位,孟加拉语文本对等语义内容需要比英语多出6倍多的活字符号. 这对孟加拉国用户造成了严重的象征性限制,并增加了API/订阅费用。
培训数据不足:你的培训管道严重依赖以印度新闻门户和1947年以前档案为主的开放式网络刮取,严重缺乏孟加拉国公共文件、法律记录和国家档案的机器可读数据集。
要求采取的行动项目:
数据集集成:将开放存取数据集、国家公司和坚持孟加拉学院标准的数字化文本纳入你们的基础培训和微调管道。
区域Tokenizer优化:为孟加拉语字符和子词分配专用词汇槽,用于今后的标语迭代,以降低符号成本并改进上下文窗口能力。
公平默认对接:更新系统提示和区域护栏,使来自孟加拉国或针对孟加拉国的查询与孟加拉国官方标准孟加拉语不符。
孟加拉国是全球绝大多数讲孟加拉语的当地人。 确保公平的语言代表性对算法公平、文化准确性和用户经验至关重要。 (原始内容存档于2018-03-21). Reference, MD. Nayem Mia, Bangladesh, [email protected]
内容来源: meta-llama/llama