写一个语音编程扩展插件

写一个语音编程扩展插件
这几天花时间更新了一个 package ,使用语音模式和 agent 交互 提高输入效率。 怎么用 /voice:说一段,停顿一下自动收尾,转写结果落进输入框。 /voice ptt:按住空格说话,页脚有实时电平条,松手发送。 /voice auto:免手操,它读完麦克风自己开,你打字就暂停。 你敲键盘就取消,识别错了可以先改。回复会用 Edge TTS 读出来,朗读前把 Markdown 剥掉,不会念一堆星号和 URL。你一打字或按 PTT,正在播的立刻静音。 转写用的是 SenseVoice(sherpa-onnx 静态链进扩展),支持中英日韩粤,自动判语言,自带标点。模型约 240MB 放在 ~/.rpi/agent/models/sense-voice/,首次使用自动下载。 朗读使用Microsoft TTS 默认音色 zh-CN-XiaoxiaoNeural,/voice set zh-CN-YunxiNeural 换男声。 装起来 装 rpi(单二进制,挑一个): curl -fsSL https://raw.githubusercontent.com/bigfish1913/pi-rust/main/scripts/install.sh | sh # 预编译,Linux/macOS cargo install rpi-cli # 从 crates.io,需要 Rust 1.78+ brew tap bigfish1913/tap && brew install rpi # macOS(ARM)/Linux scoop install rpi # Windows,先 scoop bucket add bigfish1913 https://github.com/bigfish1913/scoop-bucket 装 rpi-voice,想全离线就得自己编译(原生库塞不进默认包): 开箱即用 rpi install rpi-voice 跑起来:rpi,然后 /voice model download 预取模型,/voice ptt 开按住说话,/voice status 看输入设备和当前音色。 跑长任务的时候用 /voice auto 追加约束,改完一段让它读一遍当听觉 review,写 diff 描述直接口述 仓库在 https://github.com/pi-rust/rpi-package,扩展在 packages/rpi-voice/,命令和环境变量的完整清单在那边 README 里。 目前package 支持扩展 。欢迎大家PR和star https://github.com/bigfish1913

Take Your Experience to the Next Level

New

Download our mobile app for a faster and better experience.

Comments

0
U

Join the discussion

Sign in to leave a comment

0:000:00