arXiv · Computation and Language· Yasas Ekanayaka, Deshan Sumanathilaka·· 6 小时前AI 评分14
面向僧伽罗语 Sandhi 切分的字符级神经序列到序列方法
A Character-Level Neural Approach to Sinhala Sandhi Splitting
AI 导读
研究基于 SandhiLex 构建僧伽罗语 Sandhi 切分数据集,采用双向 LSTM 编码器与单向 LSTM 解码器的字符级序列到序列模型。在复杂词形变化、派生和词源类 Sandhi 上精确匹配准确率仅 68.40%(字符级 82.08%),远低于规则词缀类 94.00%。
来源:arXiv · Computation and Language · arxiv.org