Docs, if only one subdir skip generating style

This commit is contained in:
litagin02
2024-05-26 10:24:52 +09:00
parent ce26a0384d
commit d8ca829e28
2 changed files with 11 additions and 5 deletions

View File

@@ -82,7 +82,7 @@ Style-Bert-VITS2の学習用データセットを作成するためのツール
- 与えられた音声からちょうどいい長さの発話区間を切り取りスライス
- 音声に対して文字起こし
このうち両方を使ってもよいし、スライスする必要がない場合は後者のみを使ってもよいです。
このうち両方を使ってもよいし、スライスする必要がない場合は後者のみを使ってもよいです。**コーパス音源などすでに適度な長さの音声ファイルがある場合はスライスは不要**です。
## 必要なもの
@@ -90,13 +90,13 @@ Style-Bert-VITS2の学習用データセットを作成するためのツール
合計時間がある程度はあったほうがいいかも、10分とかでも大丈夫だったとの報告あり。単一ファイルでも良いし複数ファイルでもよい。
## スライス使い方
1. `inputs`フォルダにwavファイルをすべて入れる
1. `inputs`フォルダに音声ファイルをすべて入れる(スタイル分けをしたい場合は、サブフォルダにスタイルごとに音声を分けて入れる)
2. `モデル名`を入力して、設定を必要なら調整して`音声のスライス`ボタンを押す
3. 出来上がった音声ファイルたちは`Data/{モデル名}/raw`に保存される
## 書き起こし使い方
1. 書き起こしたい音声ファイルのあるフォルダを指定(デフォルトは`Data/{モデル名}/raw`なのでスライス後に行う場合は省略してよい)
1. `Data/{モデル名}/raw`に音声ファイルが入っていることを確認(直下でなくてもよい)
2. 設定を必要なら調整してボタンを押す
3. 書き起こしファイルは`Data/{モデル名}/esd.list`に保存される
@@ -115,6 +115,9 @@ def create_dataset_app() -> gr.Blocks:
label="モデル名を入力してください(話者名としても使われます)。"
)
with gr.Accordion("音声のスライス"):
gr.Markdown(
"**すでに適度な長さの音声ファイルからなるデータがある場合は、その音声をData/{モデル名}/rawに入れれば、このステップは不要です。**"
)
with gr.Row():
with gr.Column():
input_dir = gr.Textbox(