Qwen Audio Agent: 작업하는 동안에도 대화가 끊기지 않는 실시간 음성 에이전트 런타임

Qwen Audio Agent 소개

음성으로 AI에게 일을 시켜 본 사람이라면 익숙한 정적이 있습니다. 질문을 던지면 비서가 검색이나 도구 호출을 시작하고, 그때부터 화면에는 아무 반응이 없습니다. 몇 초가 지나 결과가 한 번에 돌아오기 전까지는 추가로 말을 걸 수도, 진행 상황을 물을 수도 없습니다. 텍스트 인터페이스라면 로딩 표시를 보며 기다리면 그만이지만, 대화는 원래 끊기지 않고 이어지는 것이라 같은 공백이 훨씬 어색하게 느껴집니다. 작업이 길어질수록 사용자는 비서가 살아 있는지조차 확신하지 못합니다.

Qwen Audio Agent는 이 공백을 없애는 데 초점을 맞춘 실시간 음성 런타임입니다. 사용자가 마주하는 대화 계층과 실제로 일을 처리하는 백엔드 에이전트 계층을 분리해서, 바로 답할 수 있는 질문은 즉시 답하고 도구나 긴 처리가 필요한 요청만 뒤로 넘긴 뒤 대화는 계속 이어갑니다. 작업이 끝나면 결과가 진행 중이던 대화로 돌아와 후속 질문이나 수정 요청을 그대로 받을 수 있습니다. 개발팀은 이 성질을 "에이전트가 늘 자리에 있는 것(Agent Presence)" 이라고 부릅니다.

특징은 자체 도구를 새로 만들지 않는다는 점입니다. 이미 설치해 둔 코딩 에이전트를 백엔드로 지정하면 그 에이전트의 모델·도구·MCP·스킬·인증 설정을 그대로 재사용합니다. 인터페이스는 WebUI와 터미널 TUI, 그리고 바탕화면에 떠 있는 음성 오브(orb) 형태의 데스크톱 앱 세 가지가 제공되며, 최신 버전은 v1.8.3 입니다. 본 게시물에서는 이 런타임의 3계층 구조, 연결할 수 있는 백엔드 에이전트, 설치와 설정 방법, 그리고 사용 전에 확인해야 할 데이터 경계를 정리합니다.

일반적인 음성 인터페이스와 Qwen Audio Agent의 차이

차이는 대부분 "작업이 진행되는 동안 대화가 어떻게 되는가"에서 나옵니다.

항목 Qwen Audio Agent 요청 단위로 처리하는 음성 인터페이스
작업 중 대화 프론트엔드 대화와 백그라운드 작업이 병렬로 진행 작업이 끝날 때까지 대기
진행 상황 언제든 진행 상황을 묻거나 취소 가능 완료 전까지 확인 불가
작업 개수 여러 작업을 독립적으로 생성해 비동기 실행 보통 한 번에 하나
결과 전달 완료된 결과가 현재 대화로 돌아와 후속 질문 연결 별도 알림이나 새 요청으로 확인
도구 설치된 코딩 에이전트의 도구·MCP·스킬을 재사용 런타임이 자체 제공하는 도구

동작을 그림으로 보면 분업이 분명합니다. 즉답할 수 있는 질문은 실시간 음성 모델이 그 자리에서 처리하고, 검색이나 추론, 에이전트 능력이 필요한 요청만 백엔드 런타임으로 위임됩니다. 사용자 입장에서는 처음부터 끝까지 같은 상대와 이야기하는 것처럼 보입니다.

Qwen Audio Agent는 누구에게 유용한가

이미 OpenCode나 Codex, Claude Code 같은 코딩 에이전트를 쓰고 있고, 손을 쓰기 어려운 상황이나 이동 중에 음성으로 작업을 던져 두고 싶은 개발자에게 잘 맞습니다. 백엔드 에이전트를 지정하지 않은 프론트엔드 전용 모드도 있어서 음성 대화만 먼저 시험해 볼 수도 있습니다. 반대로 기본 구성은 DashScope 실시간 음성 서비스로 마이크 오디오를 보내므로, 음성 데이터가 외부로 나가면 안 되는 환경이라면 로컬 speech-to-speech 프론트엔드로 바꿔야 합니다. 음성 웨이크 워드가 중국어("你好千问")로 지정되어 있다는 점, 그리고 문서와 커뮤니티가 중국어와 영어 중심이라는 점도 도입 전에 고려할 부분입니다.

Qwen Audio Agent의 3계층 구조

저장소의 아키텍처 문서는 전체를 세 계층으로 나눕니다.

1계층인 실시간 프론트스테이지는 마이크 입력을 받아 WebUI·TUI·데스크톱 앱을 거쳐 실시간 음성 모델로 전달합니다. 이 계층이 듣고 말하고 라우팅을 담당하며, 작업을 생성(spawn)하거나 상태를 확인(status)하거나 취소(cancel)하는 호출도 여기서 나갑니다.

2계층인 게이트웨이와 조정 계층에는 작업 식별자와 수명주기를 관리하는 Voice Gateway와 TaskManager가 있습니다. 작업 상태는 대기·실행·위임·마무리·완료·취소로 구분되고, 백엔드 에이전트 어댑터가 프로토콜과 이벤트를 격리하면서 권한과 세션 매핑을 처리합니다.

3계층인 선택적 지속 실행 계층은 독립적인 백엔드 에이전트 세션이 도는 곳입니다. 별도 컨텍스트와 권한을 가진 세션이 파일과 터미널, 검색, 브라우저 같은 도구를 쓰고, 세션이 유휴 상태가 되면 최종 결과가 조정 계층으로 돌아옵니다. 이 구조에서 백엔드 어댑터만 교체하면 세션과 이벤트, 취소, 권한을 지원하는 다른 에이전트를 붙일 수 있다는 것이 설계 의도입니다.

Qwen Audio Agent가 지원하는 백엔드 에이전트

백엔드는 대부분 Agent Client Protocol(ACP)로 연결되며, 저장소는 연동 완성도와 검증 수준을 별점으로 표시해 두었습니다.

백엔드 에이전트 연동 방식 설정
없음 해당 없음 프론트엔드 전용 모드, 설정 불필요
OpenCode 네이티브 ACP 원클릭 설치와 Bailian 설정
OpenClaw 내장 ACP 브리지 원클릭 설치와 Bailian 설정
Qoder 네이티브 ACP 원클릭 설치, 사용자 설정 필요
Qwen Code 네이티브 ACP 원클릭 설치, 사용자 설정 필요
Kimi Code 네이티브 ACP 원클릭 설치, 사용자 설정 필요
Hermes 네이티브 ACP 원클릭 설치, 사용자 설정 필요
CodeBuddy 네이티브 ACP 원클릭 설치, 사용자 설정 필요
Codex 외부 ACP 어댑터 기본 설치와 어댑터 설치, 사용자 설정 필요
Claude Code 외부 ACP 어댑터 기본 설치와 어댑터 설치, 사용자 설정 필요

별 다섯 개는 충분히 검증된 권장 연동, 별 네 개는 개발이 진행 중이거나 검증이 끝나지 않은 상태를 뜻합니다. qwenaudio setup 으로 사용 가능한 백엔드 목록을 확인할 수 있습니다.

Qwen Audio Agent 설치 및 실행

Node.js 22.22.2 이상 또는 24.15.0 이상과 npm 10 이상이 필요합니다.

npm install -g qwen-audio-agent

설정 파일을 만들고 키와 모델을 채웁니다. 백엔드 에이전트를 비워 두면 음성 대화만 동작하는 프론트엔드 전용 모드로 뜹니다.

DASHSCOPE_API_KEY=your-key
# 음성 프론트엔드 모델: qwen-audio-3.0-realtime-flash 또는 qwen-audio-3.0-realtime-plus(기본값)
QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus
# 백엔드 에이전트: 비워 두거나 none 이면 프론트엔드 전용 모드
AGENT_PROTOCOL=openclaw
# 백엔드 모델: 비워 두면 에이전트 자체 설정을 사용
QWEN_AUDIO_AGENT_BACKEND_MODEL=qwen3.7-max

게이트웨이를 먼저 띄우고 다른 터미널에서 TUI를 실행합니다. 브라우저 UI가 필요하면 qwenaudio webui 를 씁니다.

qwenaudio config   # 설정 파일 생성
qwenaudio          # 터미널 1: 게이트웨이
qwenaudio tui      # 터미널 2: TUI

클라우드 API 키 없이 쓰고 싶다면 Hugging Face의 speech-to-speech 프론트엔드로 바꿀 수 있습니다. 이 경우 음성 구간 검출과 인식, 언어 모델, 음성 합성이 모두 로컬에서 돌아갑니다.

데스크톱 앱은 바탕화면에 떠 있는 음성 오브 형태이며 게이트웨이를 내장합니다. 자동 숨김과 단축키 호출, 음성 웨이크 워드를 지원하고 릴리즈 페이지에서 설치 파일을 받거나 소스에서 직접 빌드할 수 있습니다.

npm run desktop:build:local      # macOS
npm run desktop:build:win        # Windows
npm run desktop:build:linux      # Linux (AppImage + deb)

Qwen Audio Agent 사용 전 확인할 점

저장소는 데이터 경계와 권한에 대해 여러 주의 사항을 명시하고 있습니다. 사용자 데이터는 ~/.config/qwaudio/ 아래에 ASSISTANT.md, USER.md, MEMORY.md, tasks.json, 로그 형태로 로컬에만 저장되고 저장소로 커밋되지 않습니다. 다만 마이크 오디오와 실시간 대화는 설정한 실시간 프론트엔드 서비스로 전송되며, 백그라운드 작업은 선택한 에이전트의 모델과 도구, MCP, 외부 서비스를 호출할 수 있습니다.

권한 설정도 확인이 필요합니다. full 권한은 백엔드가 명령을 실행하고 파일을 수정하도록 허용하므로 신뢰할 수 있는 프로젝트에서만 사용해야 하고, 비밀번호나 API 키, 인증 코드 같은 값은 사용자 선호 설정이나 대화에 남기지 않도록 안내하고 있습니다. 게이트웨이는 로컬 전용이라 네트워크나 인터넷에 직접 노출하면 안 됩니다. 에코 캔슬링이 없는 Linux와 Windows 환경에서 전이중 통화를 쓸 때는 헤드폰 착용을 권장합니다.

Qwen Audio Agent의 라이선스

Qwen Audio Agent는 Apache License 2.0으로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.

:books: Qwen Audio Agent 설치 가이드 문서

:github: Qwen Audio Agent 프로젝트 GitHub 저장소

더 읽어보기




이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. :hugs:

이 도구를 직접 설치해 사용해보셨다면, :pytorch:파이토치 한국 사용자 모임:south_korea: 회원들을 위해 경험이나 팁을 댓글로 남겨주세요! :folded_hands: