ListenHubDocs

ListenHub Hypit

참조 영상을 엔드투엔드로 다시 만듭니다 — ListenHub가 모든 소재를 생성하고, hypit이 컷을 조립하고 자막을 정렬한 뒤 로컬에서 렌더링해 계속 편집할 수 있는 프로젝트로 만들어 줍니다.

ListenHub의 대부분 skill은 결과물 하나를 만들어 냅니다 — 에피소드 하나, 트랙 하나, 이미지 한 장. listenhub-hypit이 만들어 내는 것은 영상 프로젝트입니다. 참조 클립, 브리프, 또는 사용자가 직접 찍은 소재를 받아 완성본에 무엇이 필요한지 파악하고, 빠진 소재를 모두 ListenHub로 생성한 다음, 그것들을 hypit 프로젝트로 조립합니다 — 이 프로젝트는 사용자의 머신에서 MP4로 렌더링되며, 대사 한 줄을 바꾼 뒤 다시 렌더링할 수도 있습니다.

시작하기 전에 이 역할 분담을 이해해 두면 좋습니다:

  • ListenHub는 생성과 전사를 담당합니다. 이미지, 영상 테이크, 음성, 클로닝된 보이스, 음악, 단어 단위 전사 텍스트는 모두 ListenHub의 공개 API에서 나오며 크레딧으로 과금됩니다.
  • hypit은 외부의, 로컬에 설치해 쓰는 CLI입니다. 소재를 분석하고, Script(프로젝트의 모든 대사, 세그먼트, 타이밍을 담은 hypit의 구조화된 기록)를 보관하고, 자막 정렬을 계산하고, 합성하고, 렌더링합니다. 사용자의 머신에서 실행되며 실행 자체에는 비용이 들지 않습니다.
  • 내장 Provider는 둘 사이의 다리입니다. 단어 단위 정렬과 배경 제거라는 두 가지 hypit 기능을, 서드파티 클라우드가 아니라 ListenHub를 백엔드로 제공합니다.

HypiHub 계정은 필요 없습니다. 프로젝트, 렌더링, 키잉은 사용자의 머신에 남습니다. 머신 밖으로 나가는 데이터는 ListenHub API 호출이 보내는 것뿐이며, 견적이 그 호출을 하나하나 미리 나열합니다.

트리거

/listenhub-hypit으로 이 skill을 호출하거나, 다음 문구 중 아무거나 사용하세요:

문구언어
hypit video / remake this video / reproduce this clip영어
talking pet / character dialogue / keep the original audio영어
用 ListenHub 做 hypit 视频 / 参考片复刻중국어
角色对话 / 宠物说话 / 沿用原声중국어

ListenHub Skills가 설치되어 있어야 합니다 — 시작하기를 참고하세요.

빠른 예시

Remake this clip with my product in it, keep the original BGM, swap the voiceover to English:
https://example.com/reference.mp4

AI가 클립을 프로브하고 편집 구성을 계획한 뒤, 항목별로 정리한 견적을 내놓습니다. 사용자가 승인하기 전에는 아무것도 과금되지 않습니다.

어떤 skill을 이어 붙이나요

이 skill은 생성 기능을 새로 구현하지 않습니다. 각 작업을 이미 그 일을 맡고 있는 ListenHub skill로 라우팅하며, 그 skill의 기본값을 물려받는 대신 모델과 파라미터를 명시적으로 넘깁니다.

작업라우팅 대상
캐릭터, 인물, 제품, 카메라 앵글 스틸/image-gen, 결과는 assets/에 저장됩니다
영상 테이크/video-gen, Seedance Pro / Fast 또는 MiniMax H3로 제한
내장 보이스로 하는 내레이션/tts, Script 세그먼트당 한 번 호출
여러 프로젝트에서 재사용할 보이스/voice-clone을 한 번 실행한 뒤, 저장된 speakerInnerId/tts 호출
일회성 참조 오디오 클로닝, 다중 보이스, 효과음/listenhub-voice
오리지널 음악, 스템 분리, 가사 타이밍/music
단어 단위 전사 텍스트와 자막 정렬 근거내장 Provider → ListenHub 전사
스틸 이미지 컷아웃내장 Provider → Seedream 5.0 Pro 그린 스크린 재생성, 이후 로컬 키잉
참조 클립 자체의 오디오나 BGM 재사용로컬에서 hypit / ffmpeg 처리 — 크레딧 소모 없음

사전 준비

요건비고
Node.js와 npmNode >= 22.15
listenhub CLI생성 계열 skill이 이를 통해 호출합니다
ffmpegffprobe프로브, 컷, 오디오 추출에 사용합니다
uv매니지드 런타임에 필요합니다
ListenHub API 키로컬에 기존 OpenAPI 설정이 있으면 그대로 재사용합니다

설치와 실행은 AI가 알아서 합니다 — 이 명령들을 직접 입력할 필요는 없습니다.

npx skills add hypit-ai/hypit -g
npm init -y
npm install @hypit/hypit@0.2.1
npm install --install-links <path-to-installed-skill>/listenhub-hypit/provider
npx hypit runtime init

<path-to-installed-skill>은 AI가 ListenHub Skills를 설치한 위치입니다 — AI가 스스로 찾아내며, 아래에서 언급하는 templates/ 파일도 같은 디렉터리에 있습니다.

전용 영상 프로젝트 디렉터리에서 작업하고, 모든 hypit 명령은 npx hypit으로 실행하세요. 그래야 PATH에 우연히 놓여 있는 버전이 아니라 프로젝트에 고정된 버전을 쓰게 됩니다.

hypit runtime init이 쓰는 프로필은 HypiHub을 가리킵니다. 완전히 새로 만든 프로젝트라면 이 skill의 templates/hypit.runtime.json으로 교체하고, 작업을 시작하기 전에 npx hypit runtime use ./hypit.runtime.json을 실행하세요. 기존 프로젝트라면 통째로 덮어쓰지 말고 템플릿을 병합하세요 — 프로필에 아직 필요한 로컬 설정이 들어 있을 수 있습니다.

API 키는 hypit의 자격 증명 저장소에 보관되며, 프로필이나 명령줄에는 절대 기록되지 않습니다:

npx hypit auth login listenhub.local --slot apiKey --from /private/temporary/key-file
npx hypit auth status listenhub.local --json

그 뒤에는 임시 파일을 삭제하세요. 데스크톱 키링이 없는 Linux에서는 hypit이 사용자 전용 파일로 대체하며, macOS와 Windows는 시스템 자격 증명 저장소를 사용합니다.

렌더링에는 새 머신에는 없는 매니지드 런타임(Chrome, OpenCV)이 필요합니다:

npx hypit runtime up --runtime ./hypit.runtime.json
npx hypit doctor --runtime ./hypit.runtime.json --json

이 로컬 설치에는 크레딧이 들지 않습니다. MANAGED_PROGRAM_DOWN 오류는 생성 실패가 아니라 런타임 문제입니다 — 과금되는 작업을 제출하기 전에 먼저 해결하세요.

제작이 진행되는 방식

완성본 요건 확정하기

출발점 소재, 완성본 편수, 길이, 화면 비율, 언어, 캐릭터, 보이스. AI는 아직 빠져 있으면서 결과를 바꿀 정보만 물어봅니다.

참조 영상 읽기

npx hypit media probe, tile, frames가 숏 구성, 페이싱, 동작, 화면 구도를 드러내 주고, 사용자는 원본 오디오를 듣습니다. 단어 단위 대사와 타이밍은 전사에서 나옵니다 — 다른 단계와 마찬가지로 견적에 들어가는 유료 단계입니다. 원본 오디오를 그대로 쓰고 자막이 필요 없다면 건너뛰세요.

쓰기 전에 견적 내기

과금이 일어나기 전에, 계획된 모든 호출을 가격 출처와 함께 나열하고, 합계를 내고, 잔액과 대조합니다. 비용을 참고하세요.

빠진 소재 생성하기

스틸, 테이크, 음성, 음악은 위 표의 skill을 통해 만들어져 프로젝트의 assets/로 내려받아지며, 각각 작업 ID, 프롬프트, 모델, 크레딧 비용이 함께 기록됩니다.

합성과 렌더링

소재는 asset:Image / asset:Video / asset:Audio 노드로, 또는 .svrun 안의 <file> 후보로 프로젝트에 들어갑니다. 그다음:

npx hypit check narration.svrun --json
npx hypit plan narration.svrun --runtime ./hypit.runtime.json --json
npx hypit build narration.svrun --runtime ./hypit.runtime.json --follow

checkplan의 출력에는 로컬 엔드포인트와 listenhub.local만 나와야 합니다.

완성본 확인하기

출력을 재생하고 프레임을 뽑아 확인하세요: 화면, 자막 싱크, 오디오, 매트 경계, 트랜지션. 전달물은 실제 로컬 MP4에 더해 프로젝트 경로, 견적, 그리고 실제로 소모된 크레딧과의 차이입니다.

이 skill에는 출발점이 될 템플릿 네 개 — narration, dialogue, action, cutout — 와 공용 styles.svs가 함께 들어 있습니다. 고정된 포맷이 아니라 고쳐 쓰라고 있는 예시입니다: 소재와 캐릭터 종류에는 제한이 없고, 하나의 타임라인에 대사가 있는 세그먼트와 순수 동작 세그먼트를 섞을 수 있습니다.

참조 오디오 재사용하기

이미 가지고 있는 소리를 그대로 쓰는 것이 전체 워크플로에서 가장 저렴한 길이며, 이 skill은 새로 생성하는 대신 이 방식을 기본으로 씁니다.

원하는 것방법비용
원본 화면과 원본 소리를 함께Normalize가 영상의 오디오 트랙을 유지하므로, 그것을 완성본에 믹스무료 — 로컬 처리
화면은 새로, 원본 소리는 그대로ffmpeg이나 hypit media:ExtractAudio로 트랙을 추출한 뒤 새 화면에 맞춤무료 — 로컬 처리
BGM만, 또는 보컬만소스에 분리된 트랙이 있으면 바로 꺼내 쓰고, 없으면 /music stem과금, 별도 견적
원본 목소리로 새 연기를 구동해당 오디오를 잘라내 Seedance나 MiniMax H3에 참조 오디오로 전달영상 생성으로 과금
비슷한 보이스로 새 대사/listenhub-voice로 일회성 참조 클로닝, 재사용하려면 /voice-clone과금, 별도 견적
새 음악/music — 또는 음악을 아예 넣지 않기과금, 별도 견적

트랙을 추출하면 대사를 포함해 그 안의 모든 것이 그대로 남습니다 — 보컬 제거가 아닙니다. 추출한 원본 오디오로 새 화면에 소리를 입힐 때는, 생성한 영상의 Normalize audionone으로 설정해 예전 대사가 새어 나오거나 겹치지 않게 하세요.

직접 만들지 않은 오디오에 대한 권리를 보유하는 것은 사용자의 책임입니다. skill은 사용자에게 이를 한 번 확인하도록 요구하지만, 그 답을 검증하지 않으며 사용자를 대신해 권리를 확보해 주지도 않습니다.

비용

견적을 보기 전에는 과금되는 작업이 실행되지 않습니다. 이 skill은 계획된 항목을 모두 나열합니다 — 스틸, 모델과 길이를 붙인 세그먼트별 테이크, TTS 문자 과금 단위, 음악 트랙, 전사 밀리초, 컷아웃, 클로닝 보이스 저장 — 각 가격의 출처, 합계, 잔액과 함께.

실시간 견적 엔드포인트가 존재하는 항목은 그곳에서 가격을 가져옵니다:

항목견적 엔드포인트참고 문서
영상POST /v1/video-generation/estimate-creditsAI 비디오
이미지와 컷아웃POST /v1/images/generation/estimate-credits이미지 생성
잔액GET /v1/user/subscription구독
ListenHub VoicePOST /v1/listenhub-voice/estimate-credits아직 문서화되지 않음
전사POST /v1/audio-transcriptions/estimate-credits아직 문서화되지 않음

영상 견적은 크레딧이 아니라 미국 달러로 돌아오므로, skill이 서비스의 현재 환율로 환산하고 두 수치를 모두 견적에 남깁니다. 전사는 오디오가 시작된 1분마다 1크레딧이며, 작업이 정산될 때까지는 차감이 아니라 예약 상태입니다. 계정에 Seedream 무료 이미지 할당량이 남아 있으면 컷아웃은 그 할당량에서 차감되지만, 견적 엔드포인트는 항상 전체 크레딧 비용을 보고합니다 — 그래서 견적은 최악의 경우를 보여 주고, 실제로 소모된 양은 정산 대조에서 드러납니다.

견적 엔드포인트가 없는 항목은 날짜가 표시된 요율표를 근거로 견적을 내고, 그렇게 표시합니다. 이미 있는 소재, 로컬 추출, 컷, 믹싱은 0으로 나열됩니다. 대사 한 줄을 바꾸거나 변형을 하나 추가하면 새로 생기는 작업만 다시 견적을 냅니다. 전체를 다시 확인받아야 하는 경우는 계정, 범위, 예산이 바뀔 때뿐입니다.

npx hypit pricing이 가격을 매기는 대상은 Provider의 전사와 컷아웃 호출뿐입니다. 전체 견적을 대신할 수 없으며, Provider가 내놓는 60초 요율 샘플(usageKnown: false)은 단가이지 이 작품의 비용이 아닙니다.

잔액은 호출 전후로 기록되고, 모든 작업의 ID, 모델, 과금된 산출물은 견적과 대조해 확인합니다. 실패에 따른 환불과 아직 정산되지 않은 예약은 따로 나열됩니다.

내장 Provider

Provider가 추가하는 hypit 기능은 정확히 두 개입니다. 그 밖의 모든 것은 여전히 생성 계열 skill에서 나옵니다.

기능하는 일
@hypit/whisperx@1#whisperx-alignment16 kHz 모노 PCM 오디오에서 단어 단위 전사 텍스트와 타이밍을 얻어 정렬 근거로 반환합니다
@hypit/background-removal@1#remove-backgroundSeedream 5.0 Pro로 스틸을 단색 그린 배경 위에 다시 그린 뒤, 로컬에서 키잉해 알파 채널이 있는 PNG로 출력합니다

전사가 지원하는 언어는 zh en ja ko vi th id ms fil hi ar fr de es pt ru it nl sv da fi no el pl cs hu ro bg hr sk입니다. 그 밖의 언어로 들어온 요청은 조용히 다른 경로로 넘어가지 않고 계획 단계에서 거부됩니다.

사용자가 선언한 언어는 어떤 기능을 쓸지 고르는 데 사용됩니다. 말하는 언어는 ListenHub가 스스로 감지하고 API는 언어 파라미터를 받지 않으므로, 감지된 언어가 지정한 언어와 다를 수 있습니다. 돌아온 텍스트를 실제 대사와 대조해 확인하세요.

전사는 내용 기준으로 멱등입니다. 키는 WAV 바이트, 언어, Provider contract 버전으로 만든 SHA-256이므로, 같은 입력을 다시 실행하면 크레딧을 또 예약하지 않고 원래 작업을 반환합니다 — 실패한 작업도 마찬가지입니다. 비용을 들여 다시 전사하는 것은 새 키를 동반한 의도적인 동작이지, 자동 재시도가 아닙니다.

제약

다음은 이 skill 자신의 경계이며, skill은 그 이상을 이야기하지 않습니다:

  • 참조 소재에 대한 충실도는 보장되지 않습니다. 생성된 테이크가 참조 클립의 움직임, 음색, 립싱크를 얼마나 재현하는지는 모델, 프롬프트, 원본 소재에 따라 달라지며, 렌더링하기 전에는 예측할 수 없습니다. 결과를 직접 확인하세요. 어떤 참조 영상에 대해서도 정확한 복제를 약속하지 않습니다.
  • 스템 분리는 손실을 동반합니다. 믹스된 트랙에서 보컬이나 BGM을 뽑아내면 아티팩트가 남습니다. 그 위에 무언가를 쌓기 전에 결과를 들어 보세요. 아무 믹스나 깨끗하게 분리되지는 않습니다.
  • 컷아웃은 매트가 아니라 재생성입니다. 그린 스크린 과정에서 디테일이 다시 그려질 수 있고, 출력은 소스의 정확한 치수가 아니라 지원하는 프레임 크기 중 가장 가까운 것으로 렌더링됩니다 — 출력의 실제 치수를 프로젝트에 써 넣기 전에 먼저 읽어 확인하세요. 녹색 옷을 입은 피사체나 유리처럼 반투명한 피사체는 이 경로에 맞지 않는 입력입니다. 영상 그린 스크린 작업은 이 기능이 아니라 ffmpeg으로 처리합니다.
  • 참조 오디오는 그대로 통과되지 않습니다. 원본 목소리로 생성을 구동하면 새로운 연기가 만들어집니다. 돌아온 결과의 대사, 페이싱, 음색을 확인하세요.
  • TTS 대사는 Script와 정확히 일치해야 합니다. 읽은 텍스트와 Script의 텍스트가 어긋나면 단어 단위 정렬은 실패합니다.

이 skill과 Provider는 MIT 라이선스입니다. hypit은 자체 라이선스(hypit-ai/hypit)를 따르는 외부 의존성이며, 그 라이선스는 hypit CLI, Studio, 실행 리포트, manifest의 브랜드 표기와 저작권 표시를 그대로 유지할 것과 hypit을 호스팅형 또는 유료 제품으로 재배포하지 않을 것을 요구합니다.

관련 문서

이 페이지의 내용