Update docs

This commit is contained in:
litagin02
2024-01-09 15:55:12 +09:00
parent c13eff4887
commit 4e6a1d7459
3 changed files with 14 additions and 5 deletions

View File

@@ -40,7 +40,7 @@ This repository is based on [Bert-VITS2](https://github.com/fishaudio/Bert-VITS2
Windowsを前提としています。 Windowsを前提としています。
1. [このzipファイル](https://github.com/litagin02/Style-Bert-VITS2/releases/download/1.2/Style-Bert-VITS2.zip)をダウンロードして展開します。 1. [このzipファイル](https://github.com/litagin02/Style-Bert-VITS2/releases/download/1.3/Style-Bert-VITS2.zip)をダウンロードして展開します。
- グラボがある方は、`Install-Style-Bert-VITS2.bat`をダブルクリックします。 - グラボがある方は、`Install-Style-Bert-VITS2.bat`をダブルクリックします。
- グラボがない方は、`Install-Style-Bert-VITS2-CPU.bat`をダブルクリックします。 - グラボがない方は、`Install-Style-Bert-VITS2-CPU.bat`をダブルクリックします。
2. 待つと自動で必要な環境がインストールされます。 2. 待つと自動で必要な環境がインストールされます。
@@ -114,6 +114,14 @@ API仕様は起動後に`/docs`にて確認ください。
2つのモデルを、「声音」「感情表現」「テンポ」の3点で混ぜ合わせて、新しいモデルを作ることが出来ます。 2つのモデルを、「声音」「感情表現」「テンポ」の3点で混ぜ合わせて、新しいモデルを作ることが出来ます。
`Merge.bat`をダブルクリックか`python webui_merge.py`するとWebUIが起動します。 `Merge.bat`をダブルクリックか`python webui_merge.py`するとWebUIが起動します。
### 自然性評価
学習結果のうちどのステップ数がいいかの「一つの」指標として、[SpeechMOS](https://github.com/tarepan/SpeechMOS) を使うスクリプトを用意しています:
```bash
python speech_mos.py -m <model_name>
```
ステップごとの自然性評価が表示され、`mos_results`フォルダの`mos_{model_name}.csv``mos_{model_name}.png`に結果が保存される。読み上げさせたい文章を変えたかったら中のファイルを弄って各自調整してください。またあくまでアクセントや感情表現や抑揚を全く考えない基準での評価で、目安のひとつなので、実際に読み上げさせて選別するのが一番だと思います。
## Bert-VITS2 v2.1との関係 ## Bert-VITS2 v2.1との関係
基本的にはBert-VITS2 v2.1のモデル構造を少し改造しただけです。[事前学習モデル](https://huggingface.co/litagin/Style-Bert-VITS2-1.0-base)も、実質Bert-VITS2 v2.1と同じものを使用しています不要な重みを削ってsafetensorsに変換したもの 基本的にはBert-VITS2 v2.1のモデル構造を少し改造しただけです。[事前学習モデル](https://huggingface.co/litagin/Style-Bert-VITS2-1.0-base)も、実質Bert-VITS2 v2.1と同じものを使用しています不要な重みを削ってsafetensorsに変換したもの

View File

@@ -14,19 +14,20 @@
### 改善 ### 改善
- `Dataset.bat`の音声スライスと書き起こしをよりカスタマイズできるようにスライスの秒数設定や書き起こしのWhisperモデル指定や言語指定等 - `Dataset.bat`の音声スライスと書き起こしをよりカスタマイズできるようにスライスの秒数設定や書き起こしのWhisperモデル指定や言語指定等
- `Style.bat`のスタイル作成で、新しい次元削減方法UMAPと新しいスタイル分けの方法DBSCANを追加 - `Style.bat`のスタイル作成で、スタイルごとのサンプル音声を複数再生できるように。また新しい次元削減方法UMAPと新しいスタイル分けの方法DBSCANを追加UMAPのほうがよくスタイルが分かれるかもしれません
- colabの[ノートブック](http://colab.research.google.com/github/litagin02/Style-Bert-VITS2/blob/master/colab.ipynb)で、音声ファイルのみからデータセットを作成するオプション部分を追加
- クラウド実行等の際にパスの指定をこちらでできるように、パスの設定を`configs/paths.yml`にまとめたcolabの[ノートブック](http://colab.research.google.com/github/litagin02/Style-Bert-VITS2/blob/master/colab.ipynb)もそれに伴って更新)。デフォルトは`dataset_root: Data``assets_root: model_assets`なので、クラウド等でやる方はここを変更してください。 - クラウド実行等の際にパスの指定をこちらでできるように、パスの設定を`configs/paths.yml`にまとめたcolabの[ノートブック](http://colab.research.google.com/github/litagin02/Style-Bert-VITS2/blob/master/colab.ipynb)もそれに伴って更新)。デフォルトは`dataset_root: Data``assets_root: model_assets`なので、クラウド等でやる方はここを変更してください。
- どのステップ数の出力がよいかの「一つの」指標として [SpeechMOS](https://github.com/tarepan/SpeechMOS) を使うスクリプトを追加: - どのステップ数の出力がよいかの「一つの」指標として [SpeechMOS](https://github.com/tarepan/SpeechMOS) を使うスクリプトを追加:
```bash ```bash
python speech_mos.py -m <model_name> python speech_mos.py -m <model_name>
``` ```
ステップごとの自然性評価が表示され、`mos_results`フォルダの`mos_{model_name}.csv``mos_{model_name}.png`に結果が保存される。読み上げさせたい文章を変えたかったら中のファイルを弄って各自調整してください。またあくまで目安のひとつなので、実際に読み上げさせて選別するのが一番だと思います。 ステップごとの自然性評価が表示され、`mos_results`フォルダの`mos_{model_name}.csv``mos_{model_name}.png`に結果が保存される。読み上げさせたい文章を変えたかったら中のファイルを弄って各自調整してください。またあくまで目安のひとつなので、実際に読み上げさせて選別するのが一番だと思います。
- 学習時のウォームアップオプションを機能するように( [@kale4eat](https://github.com/kale4eat) 様によるPRです、ありがとうございます学習時に生成される`config.json``train``warmup_epochs`を変更することで、ウォームアップのエポック数を変更できます。デフォルトは`0`で今までと同じ学習率の挙動です。 - 学習時のウォームアップオプションを機能するように( [@kale4eat](https://github.com/kale4eat) 様によるPRです、ありがとうございます前処理時に生成される`config.json``train``warmup_epochs`を変更することで、ウォームアップのエポック数を変更できます。デフォルトは`0`で今までと同じ学習率の挙動です。
### その他 ### その他
- `Dataset.bat`の音声スライスでノーマライズ機能を削除(学習前処理で行えるため) - `Dataset.bat`の音声スライスでノーマライズ機能を削除(学習前処理で行えるため)
- `Train.bat`の音量ノーマライズと無音切り詰めをデフォルトでオフに変更 - `Train.bat`の音量ノーマライズと無音切り詰めをデフォルトでオフに変更
- 学習時の進捗を全体エポック数で表示し、学習全体の進捗を見やすいように( @RedRayz 様によるPRです、ありがとうございます) - 学習時の進捗を全体エポック数で表示し、学習全体の進捗を見やすいように( [@RedRayz](https://github.com/RedRayz) 様によるPRです、ありがとうございます)
- その他バグ修正等( [@tinjyuu](https://github.com/@tinjyuu) 様、 [@darai0512](https://github.com/darai0512) 様ありがとうございます! ) - その他バグ修正等( [@tinjyuu](https://github.com/@tinjyuu) 様、 [@darai0512](https://github.com/darai0512) 様ありがとうございます! )
- `config.json`にスタイル埋め込み部分を学習しない`freeze_style`オプションを追加(デフォルトは`false` - `config.json`にスタイル埋め込み部分を学習しない`freeze_style`オプションを追加(デフォルトは`false`

View File

@@ -57,7 +57,7 @@ python initialize.py # Download necessary models and default TTS model
Don't forget the last step. Don't forget the last step.
### Voice Synthesis ### Voice Synthesis
Double-click `App.bat`` or run `python app.py`` to launch the WebUI. The default model is downloaded during installation, so you can use it even if you haven't trained it. Double-click `App.bat` or run `python app.py` to launch the WebUI. The default model is downloaded during installation, so you can use it even if you haven't trained it.
The structure of the model files required for voice synthesis is as follows (you don't need to place them manually): The structure of the model files required for voice synthesis is as follows (you don't need to place them manually):