借助语音大模型,实现 Linux 下的语音输入,邀请 Linux 桌面用户试试

发布于

昨天看到 IT 之家的一则新闻,内容如下:

> 识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台 [原文链接](https://www.ithome.com/0/990/679.htm)

于是我搞了一套适用于大部分 Linux 发行版和桌面环境的流程。平台送了 36000 秒(有效期 3 个月),到期后的价格是每秒 0.00022 元。

代码开源在 [这里](https://github.com/hellodk34/voice_input_linux)。

以下是截图,邀请使用 Linux 桌面的朋友们来试试。如果有用的话请留个⭐。这套流程我觉得在 Linux 桌面环境中非常轻量,日后更换模型也很简单,稍微适配一下就可以了。

![demo.webp](http://pic.zhso.org/2026/08/18/7196837cf2ce.webp)

---

原文链接:[点击查看](https://www.v2ex.com/t/1235328)

评论(1)

这效果还是挺不错的,对于一些标点和夹杂的字母、数字都能识别得不错。

· 0 个赞

0.071293s