스피킹 튜터 앱
영어 스피킹 튜터 앱 — 9개 학습 모듈을 갖춘 실시간 음성 AI 학습 엔진. 외주 계약으로 설계부터 납품까지 단독 수행
2026.05 - 현재
AI Engineer (외주 계약)
Oizi
ai-agentrealtime-voicesttllmttsspeech-assessmentedtech
프로젝트 개요
Oizi와의 외주 계약으로 수행한 영어 스피킹 튜터 앱. 학습자의 발화를 실시간으로 듣고 채점하며 코칭을 돌려주는 구조로, AI 에이전트와 백엔드 전체를 담당. 음성 파이프라인, 모듈 엔진, 평가 체계, 제휴 학습 플랫폼 연동 규격까지 설계·구현.
핵심 문제: 실시간 음성을 감당 가능한 단가로
음성 튜터는 응답이 한 박자 안에 돌아와야 하고, 자연스러운 발화여야 하며, 동시에 세션당 단가가 사업이 성립할 만큼 낮아야 한다. 세 조건이 서로 충돌하는 지점에서 설계의 방향을 잡았다 — LLM 호출을 값어치를 하는 곳에만 배치하는 것.
| 계층 | 적용 지점 | LLM 비용 |
|---|---|---|
| Seed | 고정 단계의 안내·멘트 | 없음 (사전 생성) |
| Slot | 정답·오답 피드백 | 없음 (템플릿 변수 치환) |
| LLM | 응용 코칭, 자유 역할극, 발표 평가 | 실시간 호출 |
대부분의 모듈은 세션당 LLM 호출 0회로 동작하며, 매 턴 비용이 발생하는 것은 자유 대화 계열로 한정. 체감 품질을 유지한 채 단가를 큰 폭으로 절감.
주요 역할 및 기여
- 실시간 음성 파이프라인(STT → LLM → TTS) 설계·구현 — 음성 엔진 비교 평가 후 더 나은 선택지 등장 시마다 TTS 스택 이전 수행
- 9개 학습 모듈 엔진 구축 — 강의·어휘·쉐도잉·빈칸 말하기·문장 만들기·대본 역할극·자유 역할극·1분 발표를 공통 6단계 상태머신으로 통합
- 발화 평가 체계 설계 — 발음·유창성·문법·화용·발화량 5축 및 내부 지표 구현. 0~100 종합 점수 환산을 배제하고 측정 원단위(%·WPM·오류/문장)를 그대로 노출해 학습자가 개선 지점을 파악하도록 설계
- 역할 제약 실시간 역할극 구현 — 시나리오와 배역을 벗어나지 않는 가드레일 내 자유 대화 및 목표 표현 사용 추적
- 단일 명세(정본) 수립 — 서로 충돌하는 세 개의 원본 자료(기획서·시나리오·데이터 샘플)를 하나의 구현 기준으로 통합하고 모든 충돌을 번호 붙은 결정으로 확정·기록
- 제휴 플랫폼 연동 규격 정의 — 세션 진입 시 콘텐츠를 전달받아 소비하는 수신 계약 수립 및 연동 이전 데모·QA가 가능한 스탠드얼론 경로 병행 구축
만든 방식
구현의 대부분을 코딩 에이전트가 수행하고, 사람은 의도와 방향, 현실과의 접점(클라이언트 피드백·실기기 거동), 그리고 위임이 안전하게 굴러가게 하는 조율(검증·권한·충돌 중재)을 담당하는 에이전트 주도 개발 방식으로 진행. 이 계약의 전체 기록(커밋, 사람의 개입, 폐기된 접근)을 나중에 전수 분석했으며, 그 결과가 조직의 기준과 실제 산출물의 정합을 유지하는 인프라 제품(UyooPack)의 실측 근거가 됨.
기술 스택
- AI: Whisper(STT), LLM 오케스트레이션, Google Chirp 3 HD(TTS), 발음 평가
- Backend: Node.js, TypeScript, 모노레포
- Workflow: Claude Code, Basecamp, GitHub