做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 PagedAttention,前缀缓存,连续批处理和分块预填充

发布于

jingzhou: 我做了一个极简的纯 Java 实现的 LLM 推理引擎,涵盖了现代推理服务系统的核心技术,包括:

- **分页 KV cache(PagedAttention)**
- **前缀缓存(Prefix Caching)**
- **连续批处理(Continuous Batching)**
- **分块预填充(Chunked Prefill)**
- **抢占恢复**

代码总计约 1.5K 行,依赖极少,适合入门学习;支持纯 CPU 推理,并利用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm。

目前支持 Qwen3 dense 系列模型,已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出进行了逐 token 完全一致的对齐验证。

欢迎对大模型推理感兴趣的朋友试用:[https://github.com/oujingzhou/vllm4j](https://github.com/oujingzhou/vllm4j) 欢迎 star。

---

原文链接:[点击查看](https://www.v2ex.com/t/1227572)

评论

暂无评论。