TingVoice 是一个 Windows 本地语音输入工具。它把语音转成文字后,自动复制并粘贴到当前输入位置,适合在 Codex、Cursor、微信、Word、浏览器输入框等场景中快速输入。
- 作者:沉汀(ChenTing)
- 版本:v1.0.2
- 项目主页 / 官网:https://github.com/ChenTingToDo/TingVoice
- Windows 10 或 Windows 11。
- Python 3.11 或更高版本。
- 可用的麦克风输入设备。
- 首次安装依赖和下载模型时需要联网。
快捷键或按钮开始录音
-> 单个麦克风流同时保存完整音频并送入本地流式会话
-> 悬浮窗口显示已确认文字和可替换的临时文字
-> 停止录音
-> SenseVoiceSmall 主模型识别
-> Whisper Small 备用模型兜底
-> 文本后处理
-> 自动复制
-> 自动粘贴
- 本地语音识别,不调用 OpenAI API、Whisper API 或收费云端语音识别接口。
- 默认使用 SenseVoiceSmall,偏中文和中英混合输入场景。
- Whisper Small 作为备用模型,主模型失败时自动兜底。
- 使用本地 Sherpa-ONNX Streaming Paraformer 做实时字幕预览;实时预览不会替代最终整段识别。
- 悬浮字幕窗口显示录音时长、已确认文字和临时文字,识别完成后自动隐藏。
- 支持全局快捷键开始/停止录音,默认
Right Shift。 - 支持主界面按钮开始/停止录音。
- 支持常用词库,用于修正工具名、项目名、人名和专有名词。
- 支持口头禅清理模式:原样输出、保守清理、激进清理。
- 支持中文 / English 界面切换。
- 支持首次启动安装引导和模型准备进度提示。
- 启动器准备的模型会由主界面直接复用,避免跨进程重复加载。
双击项目根目录下的:
启动 TingVoice.vbs
也可以双击桌面的 TingVoice 快捷方式。
说明:桌面快捷方式会通过 pythonw.exe 打开 GUI 启动器,正常不会弹出命令行窗口。启动 TingVoice.bat 仅作为备用入口。
第一次启动会检查 Python 环境、本地依赖和本地语音识别组件。如果本机还没有模型缓存,会自动下载:
- 主模型:SenseVoiceSmall,约 896MB。
- 备用模型:Whisper Small,约 464MB。
- 实时字幕模型:Sherpa-ONNX Streaming Paraformer 双语 int8 文件,约 226MB。
首次安装和首次下载模型需要联网。模型和依赖准备完成后,正常识别可以离线使用。实时字幕模型只从公开模型文件地址下载,不发送音频或转写文本。启动器完成准备后会在同一进程中打开主界面,第一次录音无需再次加载主模型。
1. 点击你想输入文字的位置。
2. 按一次 Right Shift 开始录音,或点击 TingVoice 的“开始录音”。
3. 说完后再按一次 Right Shift,或点击“停止录音”。
4. TingVoice 会识别、后处理,并自动粘贴文本。
- 首页:开始/停止录音和状态提示。
- 词典:维护常用词库。
- 设置:快捷键、文本处理模式、口头禅列表、麦克风、语言。
- 关于:版本、作者、项目链接和原创声明。
如果你已经录好一段音频,可以直接用本地模型验证:
python scripts\transcribe_audio_file.py 你的音频.wav输出示例:
原始识别:帮我打开项目。
最终输出:帮我打开项目
默认保存在:
%APPDATA%/TingVoice/
主要文件:
config.jsondictionary.jsonrecordings/last_attempt.wavrecordings/last_recording.wavmodels/streaming-paraformer-bilingual-zh-en/
python -m venv .venv
.\.venv\Scripts\Activate.ps1
pip install -e .[dev]
python -m tingvoicepython -m pytest
python -m compileall src tests scriptsTingVoice 是一个面向个人效率场景的本地语音输入工具,由沉汀(ChenTing)提出需求并主导设计,Codex 协助开发实现。项目仅用于本地语音输入体验探索,请遵守所用开源依赖和模型的许可协议。
由衷感谢以下开源项目和模型:PySide6(LGPL/GPL)、FunASR(MIT)、ModelScope、SenseVoiceSmall、faster-whisper(MIT)、Whisper Small、PyTorch(BSD-3-Clause)、sounddevice、soundfile(BSD)、pynput(LGPLv3)、pyperclip(BSD)、PyAutoGUI(BSD)、OpenCC Python Reimplemented(Apache License)。具体协议请以各项目仓库和模型页面的 LICENSE 为准。