ListenHub Hypit
参考動画をエンドツーエンドで作り直す — ListenHub がすべての素材を生成し、hypit がカットを組み上げ、字幕を同期させ、ローカルでレンダリングして、編集を続けられるプロジェクトを残します。
ListenHub の Skill はたいてい成果物を 1 つ作ります — エピソード、トラック、画像。listenhub-hypit が作るのは動画プロジェクトです。参考クリップ、ブリーフ、あるいはあなた自身の映像素材を受け取り、完成版に何が必要かを割り出し、足りない素材をすべて ListenHub で生成して、hypit プロジェクトに組み上げます。このプロジェクトはあなたのマシン上で MP4 にレンダリングでき、セリフを 1 行変えたあとに再レンダリングすることもできます。
始める前に、この役割分担を理解しておく価値があります:
- ListenHub は生成と文字起こしを担当します。画像、動画のテイク、音声、クローンしたボイス、音楽、単語単位の文字起こしは、いずれも ListenHub の公開 API から得られ、クレジットで課金されます。
- hypit は外部の、ローカルにインストールする CLI です。映像を解析し、Script — プロジェクト内のすべてのセリフ、セグメント、タイミングを記録した hypit の構造化データ — を保持し、字幕のアライメントを計算し、合成し、レンダリングします。あなたのマシン上で動作し、実行に費用はかかりません。
- 同梱の Provider が両者の橋渡しです。2 つの hypit 機能 — 単語単位のアライメントと背景除去 — を、サードパーティのクラウドではなく ListenHub をバックエンドとして提供します。
HypiHub のアカウントは不要です。プロジェクト、レンダリング、キーイングはあなたのマシン上にとどまります。マシンの外に出るのは、ListenHub API の呼び出しが送るものだけです — そしてその呼び出しは、見積もりで事前に 1 つずつ列挙されます。
トリガー
/listenhub-hypit でこの Skill を呼び出すか、次のいずれかのフレーズを使用します:
| フレーズ | 言語 |
|---|---|
hypit video / remake this video / reproduce this clip | 英語 |
talking pet / character dialogue / keep the original audio | 英語 |
用 ListenHub 做 hypit 视频 / 参考片复刻 | 中国語 |
角色对话 / 宠物说话 / 沿用原声 | 中国語 |
ListenHub Skills のインストールが必要です — はじめに を参照してください。
簡単な例
Remake this clip with my product in it, keep the original BGM, swap the voiceover to English:
https://example.com/reference.mp4AI がクリップを解析(probe)し、構成を計画し、項目ごとに分けた見積もりを返します。あなたが承認するまで課金は発生しません。
連鎖する機能
この Skill は生成処理を作り直しません。各ジョブを、それをすでに担っている ListenHub の Skill に振り分け、その Skill のデフォルト値を引き継ぐのではなく、モデルとパラメータを明示的に渡します。
| ジョブ | 振り分け先 |
|---|---|
| キャラクター、ポートレート、製品、カメラアングルの静止画 | /image-gen。結果は assets/ に配置されます |
| 動画のテイク | /video-gen。Seedance Pro / Fast または MiniMax H3 に限定 |
| 組み込みボイスによるナレーション | /tts。Script のセグメントごとに 1 回呼び出し |
| 複数のプロジェクトで使い回すボイス | /voice-clone を一度実行し、保存した speakerInnerId を使って /tts |
| 単発の参考音声クローン、複数ボイス、効果音 | /listenhub-voice |
| オリジナル音楽、ステム分離、歌詞のタイミング | /music |
| 単語単位の文字起こしと字幕アライメントの根拠 | 同梱の Provider → ListenHub の文字起こし |
| 静止画の切り抜き | 同梱の Provider → Seedream 5.0 Pro によるグリーンバック生成、その後ローカルでキーイング |
| 参考クリップ自身の音声や BGM の再利用 | ローカルの hypit / ffmpeg — クレジット消費なし |
前提条件
| 要件 | 備考 |
|---|---|
Node.js と npm | Node >= 22.15 |
listenhub CLI | 生成系の Skill がこれを経由して呼び出します |
ffmpeg と ffprobe | 解析(probe)、カット、音声抽出に使用します |
uv | マネージドランタイムに必要です |
| ListenHub の API キー | ローカルに既存の OpenAPI 設定があれば、それを再利用します |
インストールも実行も AI が自分で行います — これらのコマンドを自分で打つ必要はありません。
npx skills add hypit-ai/hypit -g
npm init -y
npm install @hypit/hypit@0.2.1
npm install --install-links <path-to-installed-skill>/listenhub-hypit/provider
npx hypit runtime init<path-to-installed-skill> は、AI が ListenHub Skills をインストールした場所です — AI が自分で解決しますし、下で参照している templates/ のファイルも同じディレクトリにあります。
動画プロジェクト専用のディレクトリで作業し、hypit のコマンドはすべて npx hypit 経由で実行してください。そうすれば PATH 上にあるものではなく、プロジェクトに固定されたバージョンが使われます。
hypit runtime init は HypiHub を指すプロファイルを書き出します。新規に作成したプロジェクトでは、何かを
始める前に、これを Skill の templates/hypit.runtime.json で置き換え、
npx hypit runtime use ./hypit.runtime.json を実行してください。既存のプロジェクトでは、上書きするのでは
なくテンプレートをマージしてください — プロファイルには、まだ必要なローカル設定が入っている可能性があります。
API キーは hypit の資格情報ストアに保存され、プロファイルやコマンドラインには一切書き込まれません:
npx hypit auth login listenhub.local --slot apiKey --from /private/temporary/key-file
npx hypit auth status listenhub.local --json終わったら一時ファイルは削除してください。デスクトップキーリングのない Linux では、hypit はユーザー専用ファイルにフォールバックします。macOS と Windows はシステムの資格情報ストアを使います。
レンダリングにはマネージドランタイム(Chrome、OpenCV)が必要で、これは新しいマシンには入っていません:
npx hypit runtime up --runtime ./hypit.runtime.json
npx hypit doctor --runtime ./hypit.runtime.json --jsonこれらのローカルインストールにクレジットはかかりません。MANAGED_PROGRAM_DOWN エラーはランタイムの問題であって、生成の失敗ではありません — 課金対象のものを送信する前に解消してください。
制作の流れ
作るものを固める
出発点、完成カットの本数、長さ、アスペクト比、言語、キャラクター、ボイス。AI が尋ねるのは、まだ分かっておらず、かつ結果を左右するものだけです。
参考素材を読み解く
npx hypit media probe、tile、frames が、ショット構成、テンポ、アクション、レイアウトを明らかにします。その間にあなたは元の音声を聴きます。単語単位のセリフとタイミングは文字起こしから得られます — これは課金対象のステップで、他と同じく見積もりに含まれます。音声をそのまま使い、字幕も不要な場合はスキップしてください。
足りない素材を生成する
静止画、テイク、音声、音楽は上の表の Skill を通じて生成され、プロジェクトの assets/ にダウンロードされます。それぞれタスク ID、プロンプト、モデル、クレジット消費が記録されます。
組み上げてレンダリングする
素材は asset:Image / asset:Video / asset:Audio ノードとして、または .svrun 内の <file> 候補としてプロジェクトに取り込まれます。そのうえで:
npx hypit check narration.svrun --json
npx hypit plan narration.svrun --runtime ./hypit.runtime.json --json
npx hypit build narration.svrun --runtime ./hypit.runtime.json --followcheck と plan には、ローカルのエンドポイントと listenhub.local だけが表示されなければなりません。
仕上がりを確認する
出力を再生し、フレームを抜き出して確認します:映像、字幕の同期、音声、マットのエッジ、トランジション。納品物は実際のローカル MP4 に加えて、プロジェクトのパス、見積もり、実際に消費したクレジットとの差分です。
出発点となるテンプレートが 4 つ同梱されています — narration、dialogue、action、cutout、それに共通の styles.svs。これらは編集して使う例であり、固定のフォーマットではありません:題材もキャラクターの種類も制限はなく、1 本のタイムラインにセリフのあるセグメントとアクションだけのセグメントを混在させられます。
参考音声を再利用する
すでに手元にある音をそのまま使うのが、ワークフロー全体でいちばん安く済む道であり、この Skill は生成し直すのではなくこちらをデフォルトにします。
| やりたいこと | 実現方法 | 費用 |
|---|---|---|
| 元の映像と元の音をそのまま一緒に使う | Normalize が動画の音声トラックを保持するので、それを仕上がりにミックスする | 無料 — ローカル処理 |
| 映像は新規、音は元のまま | ffmpeg または hypit の media:ExtractAudio でトラックを抽出し、新しい映像に合わせる | 無料 — ローカル処理 |
| BGM だけ、またはボーカルだけ | ソースに分離されたトラックがあればそのまま使い、なければ /music stem | 課金あり、個別に見積もり |
| 元の声で新しい演技を駆動する | 音声を切り出し、Seedance または MiniMax H3 に参考音声として渡す | 動画生成として課金 |
| 似た声で新しいセリフを作る | /listenhub-voice による単発の参考音声クローン、使い回すなら /voice-clone | 課金あり、個別に見積もり |
| 新しい劇伴 | /music — あるいは音楽を付けない | 課金あり、個別に見積もり |
トラックを抽出すると、セリフを含めてその中身がすべて残ります — ボーカル除去ではありません。抽出した元の
音声で新しい映像に音を付ける場合は、生成した動画の Normalize の audio を none にして、古いセリフが
漏れたり二重になったりしないようにしてください。
自分で作っていない音声については、その権利を保有している責任はあなたにあります。Skill は一度だけそれを確認しますが、その回答を検証することはなく、あなたに代わって権利をクリアすることもありません。
費用
見積もりを見る前に、課金対象の処理が実行されることはありません。Skill は予定している項目をすべて — 静止画、モデルと長さを添えたセグメントごとのテイク、TTS の文字単位、音楽トラック、文字起こしのミリ秒、切り抜き、クローンの保存 — 各価格の出どころ、合計、あなたの残高とともに一覧表示します。
価格は、ライブの見積もりエンドポイントが存在する限り、そこから取得します:
| 項目 | 見積もりエンドポイント | 参照 |
|---|---|---|
| 動画 | POST /v1/video-generation/estimate-credits | AI 動画 |
| 画像と切り抜き | POST /v1/images/generation/estimate-credits | 画像生成 |
| 残高 | GET /v1/user/subscription | サブスクリプション |
| ListenHub Voice | POST /v1/listenhub-voice/estimate-credits | まだドキュメント化されていません |
| 文字起こし | POST /v1/audio-transcriptions/estimate-credits | まだドキュメント化されていません |
動画の見積もりはクレジットではなく米ドルで返ってくるため、Skill はサービスの現在のレートで換算し、両方の数値を見積もりに残します。文字起こしは音声の開始された 1 分ごとに 1 クレジットで、タスクが確定するまでは控除ではなく予約として扱われます。切り抜きは、アカウントに Seedream の無料画像生成枠が残っている間はそこから消費されますが、見積もりエンドポイントは常に満額のクレジット費用を報告します — つまり見積もりは最悪ケースを示し、実際に消費された分は突き合わせで示されます。
見積もりエンドポイントがない項目は、日付入りのレート表から見積もり、その旨を明示します。既存の素材、ローカルでの抽出・カット・ミックスは 0 として一覧に載ります。セリフを 1 行変えたり、バリエーションを 1 つ増やしたりした場合は、新しく発生する作業だけを再見積もりします。全体の再確認が必要になるのは、アカウント、スコープ、予算が変わるときだけです。
npx hypit pricing が価格を出すのは、Provider の文字起こしと切り抜きの呼び出しだけです。完全な見積もりの
代わりにはなりませんし、Provider の 60 秒のレートサンプル(usageKnown: false)は単価であって、あなたの
作品の費用ではありません。
残高は各呼び出しの前後で記録され、すべてのタスクの ID、モデル、課金対象の出力が見積もりと突き合わされます。失敗による返金と未確定の予約は、別立てで一覧化されます。
同梱の Provider
Provider が追加する hypit の機能はちょうど 2 つです。それ以外はすべて、引き続き生成系の Skill から得られます。
| 機能 | 内容 |
|---|---|
@hypit/whisperx@1#whisperx-alignment | 16 kHz モノラル PCM 音声から単語単位の文字起こしとタイミングを取得し、アライメントの根拠として返します |
@hypit/background-removal@1#remove-background | Seedream 5.0 Pro で静止画を単色グリーンバック上に再生成し、ローカルでキーイングしてアルファ付き PNG にします |
文字起こしが対応する言語は zh en ja ko vi th id ms fil hi ar fr de es pt ru it nl sv da fi no el pl cs hu ro bg hr sk です。
それ以外の言語のリクエストは、黙って別の経路に回されるのではなく、計画の段階で拒否されます。
あなたが宣言した言語は機能の選択に使われます。話されている言語は ListenHub 自身が検出し、API は言語 パラメータを受け取らないため、検出された言語があなたの指定した言語と異なることがあります。返ってきた テキストを実際のセリフと照合してください。
文字起こしは内容に対して冪等です:キーは WAV のバイト列、言語、Provider の contract バージョンから求めた SHA-256 なので、同じ入力を再実行すると、クレジットを再び予約することなく元のタスクが返ります — 失敗したタスクも含めてです。費用を払って文字起こしをやり直すのは、新しいキーを伴う意図的な操作であり、自動リトライではありません。
制約
これらはこの Skill 自身の境界であり、Skill はそれを超えた話をしません:
- 参考素材への忠実さは保証されません。 生成されたテイクが参考クリップの動き、声色、リップシンクをどこまで再現するかは、モデル、プロンプト、元素材によって変わり、レンダリングする前には予測できません。結果を確認してください。どの参考動画についても、完全な再現は約束されていません。
- ステム分離は劣化を伴います。 ミックス済みトラックからボーカルや BGM を取り出すと、アーティファクトが残ります。その上に作り込む前に結果を聴いてください。どんなミックスでもきれいに分離できるわけではありません。
- 切り抜きはマットではなく再生成です。 グリーンバック生成の工程ではディテールが描き直されることがあり、出力はソースそのままの寸法ではなく、対応しているフレームサイズのうち最も近いものになります — 実際の寸法をプロジェクトに書き込む前に、出力の本当の寸法を確認してください。緑色のものを身に着けた被写体や、ガラスなど半透明のものは、この経路には適さない入力です。動画のグリーンバック処理は、この機能ではなく ffmpeg を通します。
- 参考音声はそのまま流用されるわけではありません。 元の声で生成を駆動すると、新しい演技が作られます。返ってきたもののセリフ、テンポ、声色を確認してください。
- TTS のセリフは Script と完全に一致している必要があります。 読み上げたテキストと Script のテキストが食い違うと、単語単位のアライメントは失敗します。
この Skill とその Provider は MIT ライセンスです。hypit は独自のライセンスに従う外部依存(hypit-ai/hypit)であり、hypit の CLI、Studio、実行レポート、manifest のブランド表示と著作権表示をそのまま残すこと、および hypit をホスティング型または有料の製品として再配布しないことが求められます。