VoxTune은 내 목소리를 참고해 글을 음성으로 만들고, 문장과 단어의 표현을 다듬는 웹 TTS 스튜디오입니다. 대본을 녹음 음성으로 옮기거나 같은 문장의 여러 표현을 들어보고 싶은 사람을 위한 편집 기능을 제공합니다.

마이크로 녹음하거나 음성 파일을 등록한 뒤 실제 녹음 내용을 함께 입력합니다. 목소리 파일은 브라우저의 파일 저장 공간에, 프로젝트와 음성 정보는 브라우저 데이터베이스에 보관합니다. 음성을 생성할 때는 필요한 참고 음성을 서버로 전송합니다. 등록한 목소리는 ZIP으로 백업하고 다른 기기에 가져올 수 있습니다.

대본 전체뿐 아니라 현재 문장이나 선택한 구간을 들어볼 수 있습니다. 음높이·속도·음량·강약·쉼을 조절하고 결과 파형을 확인하며, 완성한 음성은 WAV·MP3 또는 문장별 WAV를 담은 ZIP으로 내려받습니다.

React 편집기와 FastAPI 서버를 연결하고, Qwen3-TTS의 참고 음성 기반 복제 기능으로 문장을 생성합니다. 선택한 글자와 음성의 시간 위치는 Qwen3 ForcedAligner로 맞추고, FFmpeg의 Rubber Band 필터로 표현을 조절합니다. 생성과 후처리를 Redis 작업 큐로 나누며, 변경되지 않은 문장 음성은 캐시에서 재사용합니다. PostgreSQL에는 작업 상태와 처리 시간 등 운영 기록을 저장합니다.

기술 스택

  • React
  • FastAPI
  • Qwen3-TTS
  • FFmpeg
  • Redis
  • PostgreSQL