让声音,成为笔墨。
一份面向 AI 编码助手的开源项目生成提示词,用于构建 Windows 本地语音输入工具:按住说话,松开成文。
当前发布内容:提示词与文档。 本仓库不包含桌面应用源码、安装包或模型文件。下述功能是提示词的实现目标,不代表本仓库已经提供可运行的软件。
一个常驻 Windows 托盘的语音输入工具。用户在输入框中按住触发键说话,松开后,由本地模型识别语音,再将文字输入目标位置。
| 目标能力 | 提示词中的设计 |
|---|---|
| 长按说话 | 默认右 Ctrl,支持自定义触发键 |
| 本地语音识别 | FunASR-Nano、SenseVoice、Zipformer 三种模型 |
| 离线使用 | 模型准备完成后,核心识别无需联网或 API Key |
| 录音反馈 | 不抢焦点的悬浮胶囊、波形和识别状态 |
| 文本输入 | 剪贴板粘贴或 Unicode 模拟输入;失败时保留结果 |
| 可选润色 | 默认关闭,可配置云端服务或本地 LM Studio |
| 粤语场景 | 方言识别,以及可选的粤语转普通话书面语 |
| 工程约束 | C#、.NET 8、WPF、NAudio、sherpa-onnx;Windows x64 |
模型的语言范围、下载要求和实现细节以 PROMPT.md 为准。云端服务的费用、模型名称和可用性需在使用时核实。
- 打开 PROMPT.md,复制全文。
- 在一个独立的 Windows 开发目录中,把提示词交给有文件编辑与命令执行能力的 AI 编码助手。
- 先审阅助手给出的实现计划,再让它分阶段实现与验证。
- 按提示词中的验收用例检查真实录音、文本注入和异常恢复。
可以在提示词前加上这段要求:
请根据以下规格构建 Yanmo-voice(言墨)。先检查开发环境、依赖与模型接口,给出实现计划,再分阶段完成。
规格中的性能数字是参考记录,不是当前机器的验收结果。请区分已实现、已验证与待验证事项。
不得把编译成功或进程存活等同于全部功能验收通过。
本仓库保留了作者提供的提示词原文,因此其中仍可能使用 VoiceIn 等内部示例名称。实现者可以统一应用名称和数据目录,但应明确已有数据的迁移方式。
本次文档发布没有构建桌面软件,也没有重新执行模型推理、核验模型文件哈希或复测性能。提示词中的“实测”描述与数值来自原文记录,不是本仓库当前发布的测试证明。
生成实现后,至少应验证:短按、静音、60 秒自动收尾、长句完整性、剪贴板持续占用、目标窗口切换,以及注入失败后继续录音。提示词不保证任意 AI 一次生成即可通过这些检查。
本仓库仅发布提示词和说明。运行生成的软件时,需要单独考虑云端润色、剪贴板历史、诊断日志和最近识别结果的保留方式,详见 PRIVACY.md。
欢迎通过 Issue 或 Pull Request 改善提示词的准确性、可复现性与验收用例。报告问题时请附依赖版本和已脱敏的复现步骤,不要上传 API Key、私人录音、完整配置或未经检查的日志。
提示词及本仓库文档采用 MIT License,作者 Tommy。第三方依赖和语音模型不包含在本仓库内,使用与分发时须遵守各自的许可证。
Yanmo-voice is an open-source prompt and specification for AI coding assistants to build a Windows push-to-talk speech input tool using local ASR models. This repository contains documentation only, not a runnable application. Core recognition is intended to work offline after model setup; optional cloud text refinement is disabled by default. Generated implementations require their own build, privacy review, and functional validation.