词元之母TOK.MOM - 平台充值汇率 1:1 即 1 人民币充值到账 1 美元,支持一个 Key 调用近 600+ 海内外模型,限时特价模型低至 1 折,欢迎上岸!
| 来源 | 内置(默认安装) |
| 路径 | skills/mlops/models/audiocraft |
| 版本 | 1.0.0 |
| 作者 | Orchestra Research |
| 许可证 | MIT |
| 依赖 | audiocraft, torch>=2.0.0, transformers>=4.30.0 |
| 平台 | linux, macos |
| 标签 | Multimodal, Audio Generation, Text-to-Music, Text-to-Audio, MusicGen |
AudioCraft Architecture:
┌──────────────────────────────────────────────────────────────┐
│ Text Encoder (T5) │
│ │ │
│ Text Embeddings │
└────────────────────────┬─────────────────────────────────────┘
│
┌────────────────────────▼─────────────────────────────────────┐
│ Transformer Decoder (LM) │
│ Auto-regressively generates audio tokens │
│ Using efficient token interleaving patterns │
└────────────────────────┬─────────────────────────────────────┘
│
┌────────────────────────▼─────────────────────────────────────┐
│ EnCodec Audio Decoder │
│ Converts tokens back to audio waveform │
└──────────────────────────────────────────────────────────────┘| 模型 | 规模 | 描述 | 适用场景 |
|---|---|---|---|
musicgen-small | 300M | 文本转音乐 | 快速生成 |
musicgen-medium | 1.5B | 文本转音乐 | 均衡选择 |
musicgen-large | 3.3B | 文本转音乐 | 最佳质量 |
musicgen-melody | 1.5B | 文本 + 旋律 | 旋律条件化 |
musicgen-melody-large | 3.3B | 文本 + 旋律 | 最佳旋律效果 |
musicgen-stereo-* | 不定 | 立体声输出 | 立体声生成 |
musicgen-style | 1.5B | 风格迁移 | 基于参考的生成 |
audiogen-medium | 1.5B | 文本转声音 | 音效生成 |
| 参数 | 默认值 | 描述 |
|---|---|---|
duration | 8.0 | 时长(秒),范围 1-120 |
top_k | 250 | Top-k 采样 |
top_p | 0.0 | Nucleus 采样(0 = 禁用) |
temperature | 1.0 | 采样温度 |
cfg_coef | 3.0 | 无分类器引导系数 |
| 模型 | FP32 显存 | FP16 显存 |
|---|---|---|
| musicgen-small | ~4GB | ~2GB |
| musicgen-medium | ~8GB | ~4GB |
| musicgen-large | ~16GB | ~8GB |
| 问题 | 解决方案 |
|---|---|
| CUDA 显存不足 | 使用较小模型,缩短时长 |
| 质量较差 | 提高 cfg_coef,优化 prompt |
| 生成时长过短 | 检查最大时长设置 |
| 音频有杂音 | 尝试不同的 temperature |
| 立体声不生效 | 使用立体声模型变体 |