以下均可从 voxmorph 顶层或对应子模块导入。数组统一为 (帧数, 频带数) 布局。
| 名称 |
说明 |
VoiceConverter |
零样本语音转换器 |
SpeakerEncoder |
说话人嵌入编码器 |
ContentEncoder |
说话人无关的内容编码器 |
FeatureConfig / ConversionConfig |
前端与合成的配置 dataclass |
read_wav / write_wav |
WAV 读写 |
__version__ |
版本号字符串 |
VoiceConverter(feature_config=FeatureConfig(), conversion_config=ConversionConfig())
| 方法 |
返回 |
说明 |
convert(source, target, length=None) |
波形 |
端到端音色转换 |
convert_with_stats(source, target_stats, length=None) |
波形 |
复用预先算好的目标统计量 |
convert_spectrogram(source, target) |
对数幅度谱 |
只做特征域转换 |
speaker_stats(audio) |
ChannelStats |
目标说话人的逐频带统计量 |
| 函数 |
说明 |
stft(x, n_fft, hop_length, ...) / istft(...) |
STFT 与逆变换 |
melspectrogram(x, config) |
mel 功率谱 |
mfcc(x, config, n_mfcc=None) |
MFCC |
griffin_lim(magnitude, feature_config, ...) |
幅度谱 → 波形 |
get_window(name, length) |
分析窗 |
| 函数 |
说明 |
mel_cepstral_distortion(ref, test, config=None) |
梅尔倒谱失真 |
log_spectral_distance(ref, test, config=None) |
对数谱距离 |
signal_to_noise_ratio(ref, test) |
时域 SNR |
spectral_convergence(ref, test, config=None) |
谱收敛度 |
cosine_similarity(a, b) / speaker_similarity(a, b, encoder=None) |
相似度 |
equal_error_rate(scores, labels) |
等错误率 |
| 函数 |
说明 |
get_backend(name) |
按名字获取后端("numpy" / "torch") |
resolve_backend(backend) |
归一化名字 / 实例 / None 为后端对象 |