[开源] Wapic : 一个 C++17 CRF 中文分词工具

发布于

最近把自己写的中文分词工具 **Wapic** 整理并发布到了 PyPI ,想请大家试用、拍砖。

Wapic 是一个使用 C++17 实现的线性链 CRF 中文分词工具,提供 Python API ,也支持从头训练模型。

现在安装时会自动带上默认模型,不需要另外下载或现场编译:

```bash
pip install wapic
```

使用示例:

```python
import wapic

seg = wapic.Segmenter()
print(seg.segment("中华人民共和国成立了"))
```

输出:

```python
['中华人民共和国', '成立', '了']
```

目前支持:

- CPython 3.9–3.14
- Linux 、Windows 、Intel Mac 、Apple Silicon Mac
- 单句分词、BMES 标签和多核批量推理
- 加载自定义模型
- SGD-L1 、L-BFGS/OWL-QN 训练
- MIT License

发布模型在 PeopleDaily 和自建测试集上的 F1 分别为 **98.01** 和 **97.95**。

模型约 30 MB ,底层是传统 CRF ,不依赖 PyTorch 等大型运行时。

项目地址:

- GitHub:[https://github.com/Ismantic/Wapic](https://github.com/Ismantic/Wapic)
- PyPI:[https://pypi.org/project/wapic/](https://pypi.org/project/wapic/)
- 模型:[https://huggingface.co/Ismantic/Wapic-CWS](https://huggingface.co/Ismantic/Wapic-CWS)

目前尤其想收集人名、机构名、中英混排和数字表达方面的 bad case 。

如果大家愿意试一下,欢迎直接贴出分错的句子,或者在 GitHub 提交 issue 。

---

原文链接:[点击查看](https://www.v2ex.com/t/1230655)

评论

暂无评论。

0.071637s