먼저 읽는 요약
할 수 있는 일 — Stable Audio 3 Medium을 로컬에서 실행해 텍스트 요청으로 WAV를 만드는 v0.1 초기 프리뷰입니다. 편집기나 게임 엔진을 대신하지 않습니다.
윈도우 준비 — 기본 CPU 실행 경로는 32GB급 RAM과 드라이브 여유 25GB 이상을 권장합니다. 관측 메모리 사용량을 최소 사양으로 읽지 않습니다.
맥 보고 — M5 Pro·24GiB 환경의 3초 WAV 생성 보고가 있지만 최대 메모리·전체 설치량·긴 생성은 검증 범위 밖입니다.
완료 기준 — 새 에이전트 세션의 도구 발견, WAV 생성·청취, 실제 프로젝트 적용을 각각 확인합니다. 코드와 모델의 라이선스도 다릅니다.
코덱스로 게임을 만들며 필요한 타격음까지 요청할 수 있다면 편리하겠습니다. Agent Audio는 로컬 오디오 생성을 코딩 에이전트의 작업에 연결하려는 도구입니다. 다만 짧은 효과음 파일을 만드는 것과 그 소리가 실제로 적용된 게임을 완성하는 것은 구분해야 합니다.
Agent Audio가 생성하는 결과물과 지원 범위

Agent Audio는 Stable Audio 3 Medium을 로컬에서 실행하도록 MCP 서버와 Agent Skill을 묶은 통합 도구입니다. 새로운 오디오 모델을 훈련한 프로젝트는 아닙니다. 별도의 ComfyUI나 유료 오디오 생성 API 없이 구성할 수 있으며 현재는 v0.1 초기 프리뷰입니다. 코덱스가 필요할 때 호출할 수 있는 로컬 생성 도구가 추가되는 방식입니다.
현재 결과물은 텍스트 요청으로 생성한 WAV입니다. 기존 녹음을 입력해 수정하는 audio-to-audio, 일부 구간을 메우는 inpainting, 앞 소리를 이어 만드는 continuation은 현재 인터페이스에서 지원하지 않습니다. 게임 엔진이나 영상 편집기를 대신하지도 않습니다. 기반 모델은 음악도 다루지만 짧은 WAV 생성 기록으로 긴 BGM의 완성도나 청취 품질까지 확인된 것은 아닙니다. 저는 우선 몇 초짜리 효과음을 만들 수 있는지에 무게를 두고 싶습니다.
메모리·저장 공간·생성 시간을 확인합니다

윈도우의 기본 실행 경로는 TFLite/LiteRT CPU입니다. 기존 오디오 환경을 재활용하지 않은 설치와 MCP를 통한 3초·44.1kHz 스테레오 WAV 생성 기록이 있습니다. 설치 전 자원 안내는 32GB급 RAM과 설치 드라이브의 여유 공간 25GB 이상을 권장합니다. 모델 파일 약 7.36GB 외에도 패키지·캐시·임시 다운로드·출력 파일이 필요합니다.
측정된 추론 프로세스의 최대 Working Set은 약 11.56GiB입니다. 이는 해당 시험의 관측 사용량이며 최소 RAM 요구량이 아닙니다. 운영체제·편집기·다른 프로그램의 공간도 필요하므로 이 수치만 보고 16GB면 충분하다고 판단할 수 없습니다. 8GB·16GB와 긴 생성은 아직 검증되지 않았습니다. 전용 GPU가 필수는 아니지만 CUDA/TensorRT나 Intel XPU 가속도 현재 검증된 자동 실행 경로로 제공되는 상태는 아닙니다.

Apple Silicon에서는 MLX가 선택됩니다. 2026년 10월 3일 사용자 제공 보고에는 M5 Pro·통합 메모리 24GiB의 Mac mini에서 3초 WAV를 8.02초에 만들었다는 기록이 있습니다. 측정 시작·종료 지점과 캐시 상태가 빠진 단일 보고이므로 통제된 벤치마크나 반복 속도 보증으로 볼 수는 없습니다. 해당 24GiB 환경에서 짧은 소리를 생성했다는 보고로 해석하는 것이 맞습니다.
이 맥 구성의 모델 파일 합계는 약 6.88GB입니다. 런타임·캐시를 포함한 전체 설치량과 최대 통합 메모리 사용량은 측정되지 않았습니다. 24GB로 모든 길이를 생성할 수 있다는 사양표가 아니며 8GB·16GB나 긴 생성에 필요한 자원도 따로 확인해야 합니다. 윈도우 측정값을 맥 최소 사양으로 옮길 수도 없습니다.

생성 길이 입력 상한은 380초, 즉 6분 20초입니다. 하지만 CPU 생성은 느릴 수 있고 긴 요청은 540초 추론 제한에 걸릴 수 있습니다. 입력이 허용되는 길이와 실제로 완료할 수 있는 길이는 다릅니다. 짧은 효과음으로 생성 여부와 대기 시간을 먼저 확인하는 편이 낫습니다. 맥의 8.02초 보고를 윈도우에 그대로 적용해서도 안 됩니다.
MCP 등록과 실제 프로젝트 적용을 구분합니다
MCP 서버는 에이전트가 생성 도구를 호출하도록 연결하고, audio-production Skill은 이를 작업에 활용하는 방법을 안내합니다. 기존에 쓸 만한 소리가 있으면 재사용하고 없으면 필요한 소리를 생성해 프로젝트에 연결하는 방향입니다. 매번 후보를 많이 만든 뒤 사람에게 고르게 하는 절차를 기본으로 삼지는 않습니다. 다만 Skill 등록만으로 어떤 에이전트든 즉시 자동 호출한다고 보장되지는 않습니다.

설치 뒤에는 새 세션에서 도구와 Skill이 발견되는지 확인합니다. Codex·Claude Code·Cursor의 등록은 구현돼 있지만 등록 완료와 새 세션의 발견·자동 호출은 다릅니다. audio_status는 경로·모델·준비 상태를 확인하고 generate_audio는 WAV 생성 뒤 경로를 반환합니다. 파일이 실제로 존재하는지, 요청한 용도에 맞는 소리인지 직접 듣는 과정까지 필요합니다.
프로젝트 적용에는 에이전트의 게임·영상 프로젝트 접근과 적절한 편집 도구가 필요합니다. 앞의 맥 보고는 별도 MCP 클라이언트의 짧은 생성 기록이며 새 코덱스 대화가 Skill을 찾아 게임에 자동 적용한 과정까지 검증한 것은 아닙니다. README의 타격·승리 연출이나 제품 소개 영상 요청도 목표 사용 예시입니다. “소리까지 붙여줘”가 목적이면 출력 폴더뿐 아니라 실제 게임이나 영상에서 확인해야 합니다.
설치를 맡길 에이전트는 로컬 명령 실행과 설정 파일 접근이 가능해야 합니다. Git·Python 3.11 이상·uv를 확인하며 별도로 설치되는 오디오 런타임은 Python 3.12를 사용합니다. 첫 설치에는 런타임과 모델 다운로드가 포함됩니다. 저장소의 에이전트용 요청문은 환경 점검부터 짧은 WAV 생성 결과까지 보고받는 출발점으로 쓸 수 있습니다. 기존 MCP·Skill 설정과 충돌하면 원래 설정을 보존하고 겹치는 내용을 먼저 확인합니다.
생성 비용과 모델 사용 조건을 따로 확인합니다

로컬 생성에는 별도 오디오 서비스 구독료나 생성 호출당 API 요금이 없습니다. 다만 코딩 에이전트 구독료·컴퓨터·전기까지 무료가 되는 것은 아닙니다. 클라우드 오디오 서비스 대신 내 컴퓨터의 자원과 시간을 쓰는 구성입니다. 비용을 줄이는 선택이 반드시 기다림도 줄여주는 것은 아닙니다.
Agent Audio 코드는 MIT 라이선스지만 Stable Audio 3 Medium에는 Stability AI Community License, T5Gemma 구성요소에는 Gemma Terms of Use가 적용됩니다. 코드의 MIT를 모델까지 같은 조건이라고 해석하면 안 됩니다. 판매할 게임이나 수익화 영상에 쓸 계획이라면 모델·제3자 약관 안내에서 조건을 확인해야 합니다. 필요한 라이선스 동의와 인증은 본인이 진행합니다. 설치를 맡기는 것과 동의를 대신하게 하는 것은 별개입니다.
총평: 짧은 소리가 실제 장면에서 쓰이는 것부터 확인합니다
짧은 효과음을 로컬에서 생성해 볼 도구로는 시도할 이유가 있습니다. 다만 내 환경에서 실행되는지, 기다릴 만한지, 에이전트가 호출해 프로젝트에 적용하는지, 이용 목적이 모델 조건에 맞는지를 각각 확인해야 합니다. 긴 BGM과 완전 자동 편집까지 기대하기에는 미확인 범위가 큽니다. 제가 먼저 목표로 삼고 싶은 것은 필요한 짧은 소리 하나가 실제 장면에서 제때 나오는 결과입니다.
