Update docs

This commit is contained in:
litagin02
2024-01-09 18:34:26 +09:00
parent 630a873098
commit a3409240e1
2 changed files with 2 additions and 1 deletions

View File

@@ -139,7 +139,7 @@ python speech_mos.py -m <model_name>
## TODO
- [x] LinuxやWSL等、Windowsの通常環境以外でのサポート ← おそらく問題ないとの報告あり
- [ ] 複数話者学習での音声合成対応(学習は現在でも可能)
- [x] 複数話者学習での音声合成対応(学習は現在でも可能)
- [ ] 本家のver 2.1, 2.2, 2.3モデルの推論対応ver 2.1以外は明らかにめんどいのでたぶんやらない)
- [x] `server_fastapi.py`の対応、とくにAPIで使えるようになると嬉しい人が増えるのかもしれない
- [x] モデルのマージで声音と感情表現を混ぜる機能の実装

View File

@@ -13,6 +13,7 @@
これまでのモデルもこれまで通り使え、アクセントや発音等が改善される可能性があります。新しいバージョンで学習し直すとより良くなる可能性もあります。が劇的に良くなるかは分かりません。
### 改善
- `App.bat`での音声合成時に複数話者モデルの場合に話者を指定できるように
- `Dataset.bat`の音声スライスと書き起こしをよりカスタマイズできるようにスライスの秒数設定や書き起こしのWhisperモデル指定や言語指定等
- `Style.bat`のスタイル作成で、スタイルごとのサンプル音声を複数再生できるように。また新しい次元削減方法UMAPと新しいスタイル分けの方法DBSCANを追加UMAPのほうがよくスタイルが分かれるかもしれません
- colabの[ノートブック](http://colab.research.google.com/github/litagin02/Style-Bert-VITS2/blob/master/colab.ipynb)で、音声ファイルのみからデータセットを作成するオプション部分を追加