[开源] Wapic : 一个 C++17 CRF 中文分词工具
最近把自己写的中文分词工具 **Wapic** 整理并发布到了 PyPI ,想请大家试用、拍砖。
Wapic 是一个使用 C++17 实现的线性链 CRF 中文分词工具,提供 Python API ,也支持从头训练模型。
现在安装时会自动带上默认模型,不需要另外下载或现场编译:
```bash
pip install wapic
```
使用示例:
```python
import wapic
seg = wapic.Segmenter()
print(seg.segment("中华人民共和国成立了"))
```
输出:
```python
['中华人民共和国', '成立', '了']
```
目前支持:
- CPython 3.9–3.14
- Linux 、Windows 、Intel Mac 、Apple Silicon Mac
- 单句分词、BMES 标签和多核批量推理
- 加载自定义模型
- SGD-L1 、L-BFGS/OWL-QN 训练
- MIT License
发布模型在 PeopleDaily 和自建测试集上的 F1 分别为 **98.01** 和 **97.95**。
模型约 30 MB ,底层是传统 CRF ,不依赖 PyTorch 等大型运行时。
项目地址:
- GitHub:[https://github.com/Ismantic/Wapic](https://github.com/Ismantic/Wapic)
- PyPI:[https://pypi.org/project/wapic/](https://pypi.org/project/wapic/)
- 模型:[https://huggingface.co/Ismantic/Wapic-CWS](https://huggingface.co/Ismantic/Wapic-CWS)
目前尤其想收集人名、机构名、中英混排和数字表达方面的 bad case 。
如果大家愿意试一下,欢迎直接贴出分错的句子,或者在 GitHub 提交 issue 。
---
原文链接:[点击查看](https://www.v2ex.com/t/1230655)
Wapic 是一个使用 C++17 实现的线性链 CRF 中文分词工具,提供 Python API ,也支持从头训练模型。
现在安装时会自动带上默认模型,不需要另外下载或现场编译:
```bash
pip install wapic
```
使用示例:
```python
import wapic
seg = wapic.Segmenter()
print(seg.segment("中华人民共和国成立了"))
```
输出:
```python
['中华人民共和国', '成立', '了']
```
目前支持:
- CPython 3.9–3.14
- Linux 、Windows 、Intel Mac 、Apple Silicon Mac
- 单句分词、BMES 标签和多核批量推理
- 加载自定义模型
- SGD-L1 、L-BFGS/OWL-QN 训练
- MIT License
发布模型在 PeopleDaily 和自建测试集上的 F1 分别为 **98.01** 和 **97.95**。
模型约 30 MB ,底层是传统 CRF ,不依赖 PyTorch 等大型运行时。
项目地址:
- GitHub:[https://github.com/Ismantic/Wapic](https://github.com/Ismantic/Wapic)
- PyPI:[https://pypi.org/project/wapic/](https://pypi.org/project/wapic/)
- 模型:[https://huggingface.co/Ismantic/Wapic-CWS](https://huggingface.co/Ismantic/Wapic-CWS)
目前尤其想收集人名、机构名、中英混排和数字表达方面的 bad case 。
如果大家愿意试一下,欢迎直接贴出分错的句子,或者在 GitHub 提交 issue 。
---
原文链接:[点击查看](https://www.v2ex.com/t/1230655)
评论
暂无评论。