Agent skill · creative production · davila7

audiocraft-audio-generation

PyTorch library for audio generation including text-to-music (MusicGen) and text-to-sound (AudioGen). Use when you need to generate music from text descriptions, create sound effects, or perform melody-conditioned music generation.

Why this skill is useful

Adds executable scripts for generating music and sound effects from text descriptions, which are not commonly available in public resources.

What it needs

Requires audiocraft, torch, transformers installed locally. About 6k tokens when loaded. Last updated 2026-08-06. 30,138 stars on the source repository.

What this skill does

AudioCraft: Audio Generation Comprehensive guide to using Meta's AudioCraft for text-to-music and text-to-audio generation with MusicGen, AudioGen, and EnCodec. When to use AudioCraft Use AudioCraft when: Need to generate music from text descriptions Creating sound effects and environmental audio Building music generation applications Need melody-conditioned music generation Want stereo audio output Require controllable music generation with style transfer Key features: MusicGen: Text-to-music generation with melody conditioning AudioGen: Text-to-sound effects generation EnCodec: High-fidelity neural audio codec Multiple model sizes: Small (300M) to Large (3.3B) Stereo support: Full stereo audio generation Style conditioning: MusicGen-Style for reference-based generation Use alternatives instead: Stable Audio: For longer commercial music generation Bark: For text-to-speech with music/sound effects Riffusion: For spectogram-based music generation OpenAI Jukebox: For raw audio generation with lyrics Quick start Installation Basic text-to-music (AudioCraft) Using HuggingFace Transformers Text-to-sound with AudioGen Core concepts Architecture overview Model variants Model Size Description Use Case ------- ------ ------------- ---------- musicgen-small 300M Text-to-music Quick generation musicgen-medium 1.5B Text-to-music Balanced musicgen-large 3.3B Text-to-music Best quality musicgen-melody 1.5B Text + melody Melody conditioning musicgen-melody-large 3.3B Text + melody Best melody musicgen-stereo- Varies Stereo output Stereo generation musicgen-style 1.5B Style transfer Reference-based audiogen-medium 1.5B Text-to-sound Sound effects Generation parameters Parameter Default Description ----------- --------- ------------- duration 8.0 Length in seconds (1-120) topk 250 Top-k sampling topp 0.0 Nucleus sampling (0 = disabled) temperature 1.0 Sampling temperature cfgcoef 3.0 Classifier-free guidance MusicGen usage Text-to-music generation Melody-conditioned generation Stere …

How to use it

Reference it in AdaL, Claude Code, Cursor or any coding agent — nothing to install:

@skills davila7/multimodal-audiocraft

View the source on GitHub

Browse the @skills marketplace