Update (WIP)

This commit is contained in:
litagin02
2024-01-05 16:16:07 +09:00
parent 7ba7d52f50
commit 6ca9c214fc
5 changed files with 79 additions and 54 deletions

View File

@@ -40,7 +40,8 @@
"\n",
"!git clone https://github.com/litagin02/Style-Bert-VITS2.git\n",
"%cd Style-Bert-VITS2/\n",
"!pip install -r requirements.txt"
"!pip install -r requirements.txt\n",
"!apt install libcublas11"
]
},
{
@@ -92,7 +93,6 @@
"\n",
"\n",
"with open(\"configs/paths.yml\", \"w\", encoding=\"utf-8\") as f:\n",
"\n",
" yaml.dump({\"dataset_root\": dataset_root, \"assets_root\": assets_root}, f)"
]
},
@@ -100,9 +100,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"### 音声ファイルからのデータセットの作成(ある人はスキップ可)\n",
"## 2. 学習に使うデータ準備\n",
"\n",
"音声ファイル1ファイル2-12秒程度とその書き起こしデータセットを持っていない方は、音声ファイルのみから以下の手順でデータセットを作成することができます。デフォルトではGoogle drive上の`Style-Bert-VITS2/inputs/`に音声ファイルwavファイル形式、1ファイルでも複数ファイルでも可を置いて、下を実行すると、データセットが作られます。"
"すでに音声ファイル1ファイル2-12秒程度とその書き起こしデータがある場合は2.2を、ない場合は2.1を実行してください。"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### 2.1 音声ファイルからのデータセットの作成(ある人はスキップ可)\n",
"\n",
"音声ファイル1ファイル2-12秒程度とその書き起こしのデータセットを持っていない方は、日本語の音声ファイルのみから以下の手順でデータセットを作成することができます。Google drive上の`Style-Bert-VITS2/inputs/`フォルダに音声ファイルwavファイル形式、1ファイルでも複数ファイルでも可を置いて、下を実行すると、データセットが作られます。"
]
},
{
@@ -124,13 +133,17 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 2. データの配置"
"成功したらそのまま3へ進んでください"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### 音声ファイルと書き起こしデータがすでにある場合\n",
"\n",
"指示に従って適切にデータセットを配置してください。\n",
"\n",
"次のセルを実行して、学習データをいれるフォルダ1で設定した`dataset_root`)を作成します。"
]
},
@@ -151,7 +164,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"次に、学習に必要なデータを、Google driveに作成されたStyle-Bert-VITS2/Dataフォルダに配置します。\n",
"次に、学習に必要なデータを、Google driveに作成された`Style-Bert-VITS2/Data`フォルダに配置します。\n",
"\n",
"### データセットの準備\n",
"まず音声データwavファイルで1ファイルが2-12秒程度の、長すぎず短すぎない発話のものをいくつかと、書き起こしテキストを用意してください。\n",
@@ -219,11 +232,11 @@
"# 保存頻度。何ステップごとにモデルを保存するか。分からなければデフォルトのままで。\n",
"save_every_steps = 1000\n",
"\n",
"# 音声ファイルの音量を正規化するかどうか。\n",
"normalize = True\n",
"# 音声ファイルの音量を正規化するかどうか。`True`もしくは`False`\n",
"normalize = False\n",
"\n",
"# 音声ファイルの開始・終了にある無音区間を削除するかどうか\n",
"trim = True"
"trim = False"
]
},
{
@@ -252,7 +265,7 @@
" batch_size=batch_size,\n",
" epochs=epochs,\n",
" save_every_steps=save_every_steps,\n",
" bf16_run=False, # colabの無料のやつではサポートされていないようです。\n",
" bf16_run=False,\n",
" num_processes=2,\n",
" normalize=normalize,\n",
" trim=trim,\n",
@@ -287,6 +300,7 @@
"# 上でつけたモデル名を入力。学習を途中からする場合はきちんとモデルが保存されているフォルダ名を入力。\n",
"model_name = \"your_model_name\"\n",
"\n",
"\n",
"import yaml\n",
"from webui_train import get_path\n",
"\n",
@@ -298,7 +312,6 @@
"with open(\"config.yml\", \"w\", encoding=\"utf-8\") as f:\n",
" yaml.dump(yml_data, f, allow_unicode=True)\n",
"\n",
"\n",
"!python train_ms.py --config {config_path} --model {dataset_path} --assets_root {assets_root}"
]
},