Update (WIP)
This commit is contained in:
35
colab.ipynb
35
colab.ipynb
@@ -40,7 +40,8 @@
|
||||
"\n",
|
||||
"!git clone https://github.com/litagin02/Style-Bert-VITS2.git\n",
|
||||
"%cd Style-Bert-VITS2/\n",
|
||||
"!pip install -r requirements.txt"
|
||||
"!pip install -r requirements.txt\n",
|
||||
"!apt install libcublas11"
|
||||
]
|
||||
},
|
||||
{
|
||||
@@ -92,7 +93,6 @@
|
||||
"\n",
|
||||
"\n",
|
||||
"with open(\"configs/paths.yml\", \"w\", encoding=\"utf-8\") as f:\n",
|
||||
"\n",
|
||||
" yaml.dump({\"dataset_root\": dataset_root, \"assets_root\": assets_root}, f)"
|
||||
]
|
||||
},
|
||||
@@ -100,9 +100,18 @@
|
||||
"cell_type": "markdown",
|
||||
"metadata": {},
|
||||
"source": [
|
||||
"### 音声ファイルからのデータセットの作成(ある人はスキップ可)\n",
|
||||
"## 2. 学習に使うデータ準備\n",
|
||||
"\n",
|
||||
"音声ファイル(1ファイル2-12秒程度)とその書き起こしのデータセットを持っていない方は、音声ファイルのみから以下の手順でデータセットを作成することができます。デフォルトではGoogle drive上の`Style-Bert-VITS2/inputs/`に音声ファイル(wavファイル形式、1ファイルでも複数ファイルでも可)を置いて、下を実行すると、データセットが作られます。"
|
||||
"すでに音声ファイル(1ファイル2-12秒程度)とその書き起こしデータがある場合は2.2を、ない場合は2.1を実行してください。"
|
||||
]
|
||||
},
|
||||
{
|
||||
"cell_type": "markdown",
|
||||
"metadata": {},
|
||||
"source": [
|
||||
"### 2.1 音声ファイルからのデータセットの作成(ある人はスキップ可)\n",
|
||||
"\n",
|
||||
"音声ファイル(1ファイル2-12秒程度)とその書き起こしのデータセットを持っていない方は、(日本語の)音声ファイルのみから以下の手順でデータセットを作成することができます。Google drive上の`Style-Bert-VITS2/inputs/`フォルダに音声ファイル(wavファイル形式、1ファイルでも複数ファイルでも可)を置いて、下を実行すると、データセットが作られます。"
|
||||
]
|
||||
},
|
||||
{
|
||||
@@ -124,13 +133,17 @@
|
||||
"cell_type": "markdown",
|
||||
"metadata": {},
|
||||
"source": [
|
||||
"## 2. データの配置"
|
||||
"成功したらそのまま3へ進んでください"
|
||||
]
|
||||
},
|
||||
{
|
||||
"cell_type": "markdown",
|
||||
"metadata": {},
|
||||
"source": [
|
||||
"### 音声ファイルと書き起こしデータがすでにある場合\n",
|
||||
"\n",
|
||||
"指示に従って適切にデータセットを配置してください。\n",
|
||||
"\n",
|
||||
"次のセルを実行して、学習データをいれるフォルダ(1で設定した`dataset_root`)を作成します。"
|
||||
]
|
||||
},
|
||||
@@ -151,7 +164,7 @@
|
||||
"cell_type": "markdown",
|
||||
"metadata": {},
|
||||
"source": [
|
||||
"次に、学習に必要なデータを、Google driveに作成されたStyle-Bert-VITS2/Dataフォルダに配置します。\n",
|
||||
"次に、学習に必要なデータを、Google driveに作成された`Style-Bert-VITS2/Data`フォルダに配置します。\n",
|
||||
"\n",
|
||||
"### データセットの準備\n",
|
||||
"まず音声データ(wavファイルで1ファイルが2-12秒程度の、長すぎず短すぎない発話のものをいくつか)と、書き起こしテキストを用意してください。\n",
|
||||
@@ -219,11 +232,11 @@
|
||||
"# 保存頻度。何ステップごとにモデルを保存するか。分からなければデフォルトのままで。\n",
|
||||
"save_every_steps = 1000\n",
|
||||
"\n",
|
||||
"# 音声ファイルの音量を正規化するかどうか。\n",
|
||||
"normalize = True\n",
|
||||
"# 音声ファイルの音量を正規化するかどうか。`True`もしくは`False`\n",
|
||||
"normalize = False\n",
|
||||
"\n",
|
||||
"# 音声ファイルの開始・終了にある無音区間を削除するかどうか\n",
|
||||
"trim = True"
|
||||
"trim = False"
|
||||
]
|
||||
},
|
||||
{
|
||||
@@ -252,7 +265,7 @@
|
||||
" batch_size=batch_size,\n",
|
||||
" epochs=epochs,\n",
|
||||
" save_every_steps=save_every_steps,\n",
|
||||
" bf16_run=False, # colabの無料のやつではサポートされていないようです。\n",
|
||||
" bf16_run=False,\n",
|
||||
" num_processes=2,\n",
|
||||
" normalize=normalize,\n",
|
||||
" trim=trim,\n",
|
||||
@@ -287,6 +300,7 @@
|
||||
"# 上でつけたモデル名を入力。学習を途中からする場合はきちんとモデルが保存されているフォルダ名を入力。\n",
|
||||
"model_name = \"your_model_name\"\n",
|
||||
"\n",
|
||||
"\n",
|
||||
"import yaml\n",
|
||||
"from webui_train import get_path\n",
|
||||
"\n",
|
||||
@@ -298,7 +312,6 @@
|
||||
"with open(\"config.yml\", \"w\", encoding=\"utf-8\") as f:\n",
|
||||
" yaml.dump(yml_data, f, allow_unicode=True)\n",
|
||||
"\n",
|
||||
"\n",
|
||||
"!python train_ms.py --config {config_path} --model {dataset_path} --assets_root {assets_root}"
|
||||
]
|
||||
},
|
||||
|
||||
Reference in New Issue
Block a user