做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 PagedAttention,前缀缓存,连续批处理和分块预填充
jingzhou: 我做了一个极简的纯 Java 实现的 LLM 推理引擎,涵盖了现代推理服务系统的核心技术,包括:
- **分页 KV cache(PagedAttention)**
- **前缀缓存(Prefix Caching)**
- **连续批处理(Continuous Batching)**
- **分块预填充(Chunked Prefill)**
- **抢占恢复**
代码总计约 1.5K 行,依赖极少,适合入门学习;支持纯 CPU 推理,并利用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm。
目前支持 Qwen3 dense 系列模型,已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出进行了逐 token 完全一致的对齐验证。
欢迎对大模型推理感兴趣的朋友试用:[https://github.com/oujingzhou/vllm4j](https://github.com/oujingzhou/vllm4j) 欢迎 star。
---
原文链接:[点击查看](https://www.v2ex.com/t/1227572)
- **分页 KV cache(PagedAttention)**
- **前缀缓存(Prefix Caching)**
- **连续批处理(Continuous Batching)**
- **分块预填充(Chunked Prefill)**
- **抢占恢复**
代码总计约 1.5K 行,依赖极少,适合入门学习;支持纯 CPU 推理,并利用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm。
目前支持 Qwen3 dense 系列模型,已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出进行了逐 token 完全一致的对齐验证。
欢迎对大模型推理感兴趣的朋友试用:[https://github.com/oujingzhou/vllm4j](https://github.com/oujingzhou/vllm4j) 欢迎 star。
---
原文链接:[点击查看](https://www.v2ex.com/t/1227572)
评论
暂无评论。