开源一个统计语言模型驱动的中文输入法 Sime,支持 Linux / Android / macOS

7 月 9 日
 iarch

Hi,大家好:

完全自研的中文输入法「是语输入法引擎 Sime 」,过来分享一下。

核心是 C++ 引擎 + 自训语言模型(百亿字语料),整句解码。几个特点:

目前支持 Linux ( fcitx5 )、Android 、macOS ,iOS 在计划中。

仓库: https://github.com/Ismantic/Sime 下载: https://github.com/Ismantic/Sime/releases/latest

还在持续开发中,欢迎试用和拍砖,遇到问题提 issue 就行。

非常期待大家提出意见,任何反馈对我来说都是很宝贵的,也期望能多些 Star ,能让我继续改进下去,谢谢。

1584 次点击
所在节点    分享创造
9 条回复
iarch
7 月 9 日
其实这个项目很适合对中文输入法感兴趣的人学习,自认为这个项目包含了全部训练和推理的输入法实现细节。
dddedd
7 月 9 日
没有 win 吗
iarch
7 月 9 日
@dddedd 其实可以搞,引擎是统一的,用 Cc/Codex 实现个前端也不难。
SayHelloHi
7 月 10 日
后期词库如何升级?
omph
7 月 10 日
语料模型,研究一下是什么
iarch
7 月 10 日
把驱动这个输入法的中文分词部分也顺带说一下,项目地址:github.com/Ismantic/IsCut 这个是专门配套前面的输入法项目的分词库。若是随便搭配一个分词去做语言模型统计的话,要控制词表大小的话,不可避免会引入很多 OOV ,这对输入法其实是不可接受的,输入法该能做到输入全部合法汉字。这个库就是解决这个问题的。
iarch
7 月 10 日
@SayHelloHi http://github.com/Ismantic/IsCut 词库部分依赖这个中文分词库,可以看看这个
iarch
7 月 29 日
更新:把 AUR 流程完成了,ArchLinux 下可以通过 yay -S fcitx5-sime 安装了
iarch
8 月 2 日
更新:尝试了下蒸馏,改进了下延迟,推荐试用下 Android 版

https://github.com/Ismantic/SimeApp/releases/tag/v0.15.4

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1226167

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX