From d8ca829e28b4dbce6f19a126f57e0667b06331a9 Mon Sep 17 00:00:00 2001 From: litagin02 Date: Sun, 26 May 2024 10:24:52 +0900 Subject: [PATCH] Docs, if only one subdir skip generating style --- default_style.py | 7 +++++-- gradio_tabs/dataset.py | 9 ++++++--- 2 files changed, 11 insertions(+), 5 deletions(-) diff --git a/default_style.py b/default_style.py index abad90e..bfe5698 100644 --- a/default_style.py +++ b/default_style.py @@ -50,8 +50,11 @@ def save_styles_by_dirs(wav_dir: Union[Path, str], output_dir: Union[Path, str]) subdirs = [d for d in wav_dir.iterdir() if d.is_dir()] subdirs.sort() - if not subdirs: - logger.warning("No style directories found. Saving only neutral style.") + if len(subdirs) in (0, 1): + logger.info( + f"At least 2 subdirectories are required for generating style vectors with respect to them, found {len(subdirs)}." + ) + logger.info("Generating only neutral style vector instead.") save_neutral_vector(wav_dir, output_dir) # First get mean of all for Neutral diff --git a/gradio_tabs/dataset.py b/gradio_tabs/dataset.py index 35fccb3..f6ad278 100644 --- a/gradio_tabs/dataset.py +++ b/gradio_tabs/dataset.py @@ -82,7 +82,7 @@ Style-Bert-VITS2の学習用データセットを作成するためのツール - 与えられた音声からちょうどいい長さの発話区間を切り取りスライス - 音声に対して文字起こし -このうち両方を使ってもよいし、スライスする必要がない場合は後者のみを使ってもよいです。 +このうち両方を使ってもよいし、スライスする必要がない場合は後者のみを使ってもよいです。**コーパス音源などすでに適度な長さの音声ファイルがある場合はスライスは不要**です。 ## 必要なもの @@ -90,13 +90,13 @@ Style-Bert-VITS2の学習用データセットを作成するためのツール 合計時間がある程度はあったほうがいいかも、10分とかでも大丈夫だったとの報告あり。単一ファイルでも良いし複数ファイルでもよい。 ## スライス使い方 -1. `inputs`フォルダにwavファイルをすべて入れる +1. `inputs`フォルダに音声ファイルをすべて入れる(スタイル分けをしたい場合は、サブフォルダにスタイルごとに音声を分けて入れる) 2. `モデル名`を入力して、設定を必要なら調整して`音声のスライス`ボタンを押す 3. 出来上がった音声ファイルたちは`Data/{モデル名}/raw`に保存される ## 書き起こし使い方 -1. 書き起こしたい音声ファイルのあるフォルダを指定(デフォルトは`Data/{モデル名}/raw`なのでスライス後に行う場合は省略してよい) +1. `Data/{モデル名}/raw`に音声ファイルが入っていることを確認(直下でなくてもよい) 2. 設定を必要なら調整してボタンを押す 3. 書き起こしファイルは`Data/{モデル名}/esd.list`に保存される @@ -115,6 +115,9 @@ def create_dataset_app() -> gr.Blocks: label="モデル名を入力してください(話者名としても使われます)。" ) with gr.Accordion("音声のスライス"): + gr.Markdown( + "**すでに適度な長さの音声ファイルからなるデータがある場合は、その音声をData/{モデル名}/rawに入れれば、このステップは不要です。**" + ) with gr.Row(): with gr.Column(): input_dir = gr.Textbox(