Talktree

주니어 대상 실시간 AI 영어 회화앱 - STT-LLM-TTS 엔드투엔드 응답 시간 70% 이상 단축

2024 (단기 프로젝트)
Performance Engineer (Freelancer)
호두랩스
performance-optimizationreal-time-aisttllmtts

프로젝트 개요

주니어 학습자용 실시간 AI 영어 회화앱 Talktree의 응답 속도를 개선하기 위한 단기 프로젝트. 제품은 정상 동작했으나 응답이 느려 아이들의 발화 참여가 떨어지는 상황.

핵심 문제: 직렬 단계는 더해진다

음성 파이프라인은 음성인식 → 언어모델 → 음성합성 순서로 동작한다. 이를 엄격한 순차 구조로 두면 사용자는 세 구간의 합을 기다리게 되는데, 각 구간을 따로 떼어놓고 보면 어느 것도 특별히 느리지 않다. 이러한 지연이 오래 살아남는 이유다 — 모든 구성 요소가 각자의 벤치마크를 통과하기 때문이다.

해법은 구성 요소가 아닌 구조에 있었다 — 구간을 단축하는 대신 겹치는 것. 인식은 중간 결과를 스트리밍하고, 생성은 발화 종료 이전에 시작하며, 합성은 완성된 문장이 아닌 첫 어구에서 출발하도록 설계. 합으로 누적되던 지연을 가장 긴 단일 구간에 가깝게 축소.

주요 역할 및 기여

  • STT-LLM-TTS 파이프라인 전 구간 프로파일링 — 시간이 실제로 소요되는 지점을 가정이 아닌 측정으로 확인
  • 엔드투엔드 응답 시간 70% 이상 단축 — 구성 요소별 벤치마크가 아닌 사용자 체감 전체 경로 기준 측정
  • 실시간 스트리밍 최적화 — 후단 단계가 완료를 기다리지 않고 부분 입력으로 착수하도록 개선
  • 비동기 처리·캐싱 도입 — 실시간 경로에 있을 필요가 없는 작업을 분리

기술 스택

  • AI Pipeline: STT, LLM, TTS Integration
  • Optimization: Streaming, Async Processing, Caching
  • Monitoring: Performance Profiling, Latency Analysis