Skip to content

Latest commit

 

History

History
55 lines (43 loc) · 2.01 KB

File metadata and controls

55 lines (43 loc) · 2.01 KB

API 速查

以下均可从 voxmorph 顶层或对应子模块导入。数组统一为 (帧数, 频带数) 布局。

顶层

名称 说明
VoiceConverter 零样本语音转换器
SpeakerEncoder 说话人嵌入编码器
ContentEncoder 说话人无关的内容编码器
FeatureConfig / ConversionConfig 前端与合成的配置 dataclass
read_wav / write_wav WAV 读写
__version__ 版本号字符串

VoiceConverter

VoiceConverter(feature_config=FeatureConfig(), conversion_config=ConversionConfig())
方法 返回 说明
convert(source, target, length=None) 波形 端到端音色转换
convert_with_stats(source, target_stats, length=None) 波形 复用预先算好的目标统计量
convert_spectrogram(source, target) 对数幅度谱 只做特征域转换
speaker_stats(audio) ChannelStats 目标说话人的逐频带统计量

特征前端(voxmorph.features

函数 说明
stft(x, n_fft, hop_length, ...) / istft(...) STFT 与逆变换
melspectrogram(x, config) mel 功率谱
mfcc(x, config, n_mfcc=None) MFCC
griffin_lim(magnitude, feature_config, ...) 幅度谱 → 波形
get_window(name, length) 分析窗

评价(voxmorph.evaluation

函数 说明
mel_cepstral_distortion(ref, test, config=None) 梅尔倒谱失真
log_spectral_distance(ref, test, config=None) 对数谱距离
signal_to_noise_ratio(ref, test) 时域 SNR
spectral_convergence(ref, test, config=None) 谱收敛度
cosine_similarity(a, b) / speaker_similarity(a, b, encoder=None) 相似度
equal_error_rate(scores, labels) 等错误率

后端(voxmorph.backends

函数 说明
get_backend(name) 按名字获取后端("numpy" / "torch"
resolve_backend(backend) 归一化名字 / 实例 / None 为后端对象