This commit is contained in:
litagin02
2024-01-04 11:30:14 +09:00
parent b03f68ef57
commit c7571a7c39
12 changed files with 213 additions and 54 deletions

View File

@@ -54,11 +54,23 @@
"!python initialize.py"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"# Google driveを使う方はこちらを実行してください。\n",
"\n",
"from google.colab import drive\n",
"drive.mount(\"/content/drive\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## 1. 初期設定\n",
"## 1. 初期設定(とデータセット作成)\n",
"\n",
"学習とその結果を保存するディレクトリ名を指定します。\n",
"Google driveの場合はそのまま実行、カスタマイズしたい方は変更して実行してください。"
@@ -70,12 +82,17 @@
"metadata": {},
"outputs": [],
"source": [
"# 学習に必要なファイルや途中経過が保存されるディレクトリ\n",
"dataset_root = \"/content/drive/MyDrive/Style-Bert-VITS2/Data\"\n",
"\n",
"# 学習結果(音声合成に必要なファイルたち)が保存されるディレクトリ\n",
"assets_root = \"/content/drive/MyDrive/Style-Bert-VITS2/model_assets\"\n",
"\n",
"import yaml\n",
"\n",
"\n",
"with open(\"configs/paths.yml\", \"w\", encoding=\"utf-8\") as f:\n",
"\n",
" yaml.dump({\"dataset_root\": dataset_root, \"assets_root\": assets_root}, f)"
]
},
@@ -83,25 +100,31 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 2. Google Driveとの連携とデータの配置\n",
"### 音声ファイルからのデータセットの作成(ある人はスキップ可)\n",
"\n",
"Google driveにデータを保存する方は、次のセルを実行して、Google driveと連携します。"
"音声ファイル1ファイル2-12秒程度とその書き起こしのデータセットを持っていない方は、音声ファイルのみから以下の手順でデータセットを作成することができます。デフォルトではGoogle drive上の`Style-Bert-VITS2/inputs/`に音声ファイルwavファイル形式、1ファイルでも複数ファイルでも可を置いて、下を実行すると、データセットが作られます。"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {
"colab": {
"base_uri": "https://localhost:8080/"
},
"id": "xzbmRmVfP29m",
"outputId": "bd492fba-3cba-4002-b6d9-f144f701fce6"
},
"metadata": {},
"outputs": [],
"source": [
"from google.colab import drive\n",
"drive.mount(\"/content/drive\")"
"# 元となる音声ファイルwav形式を入れるディレクトリ\n",
"input_dir = \"/content/drive/MyDrive/Style-Bert-VITS2/inputs\"\n",
"# モデル名(話者名)を入力\n",
"model_name = \"your_model_name\"\n",
"\n",
"!python slice.py -i {input_dir} -o {dataset_root}/{model_name}/raw\n",
"!python transcribe.py -i {dataset_root}/{model_name}/raw -o {dataset_root}/{model_name}/esd.list --speaker_name {model_name} --compute_type float16"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## 2. データの配置"
]
},
{
@@ -186,7 +209,7 @@
"# 上でつけたフォルダの名前`Data/{model_name}/`\n",
"model_name = \"your_model_name\"\n",
"\n",
"# 学習のバッチサイズ。4ぐらいが最適か。VRAMのはみ出具合に応じて調整してください。\n",
"# 学習のバッチサイズ。VRAMのはみ出具合に応じて調整してください。\n",
"batch_size = 4\n",
"\n",
"# 学習のエポック数(データセットを合計何周するか)。\n",