Files
sbv2-v2/docs/CHANGELOG.md
litagin02 7358f5e426 Update
2024-01-08 18:23:27 +09:00

3.5 KiB
Raw Blame History

Changelog

v1.3

大きい変更

  • 日本語の発音・アクセント処理部分のバグを大幅に改良
    • 車両シャリヨオ見つけるミッケルと発音・学習されており、その単語のアクセント情報が全て死んでいた
    • 私はそれを見るのアクセントがワ➚タシ➘ワ ソ➚レ➘オ ミ➘ルだったのをワ➚タシワ ソ➚レ オ ミ➘ルに修正
  • アクセントの誤りを修正して音声合成できるように(万能制御ではない)。
  • これまでのモデルにも使える。アクセントや発音等が改善される可能性あり。学習し直すとよりよくなる可能性もある。

改善

  • Dataset.batの音声スライスと書き起こしをよりカスタマイズできるように秒数指定や書き起こしのWhisperモデル指定や言語指定等
  • Style.batのスタイル作成で、新しい可視化方法UMAPと新しいスタイル分けの方法DBSCANを追加
  • クラウド実行等の際にパスの指定をこちらでできるように、パスの設定をconfigs/paths.ymlにまとめたcolabのノートブックもそれに伴って更新)。デフォルトはdataset_root: Dataassets_root: model_assetsなので、クラウド等でやる方はここを変更してください。
  • どのステップ数の出力がよいかの「一つの」指標として SpeechMOS を使うスクリプトを追加:
python speech_mos.py -m <model_name>

ステップごとの自然性評価が表示され、mos_{model_name}.csvmos_{model_name}.pngに結果が保存される。読み上げさせたい文章を変えたかったら中のファイルを弄って各自調整してください。またあくまで目安のひとつなので、実際に読み上げさせて選別するのが一番だと思います。

v1.2 (2023-12-31)

  • グラボがないユーザーでの音声合成をサポート、Install-Style-Bert-VITS2-CPU.batでインストール。
  • Google Colabでの学習をサポート、ノートブックを追加
  • 音声合成のAPIサーバーを追加、python server_fastapi.pyで起動します。API仕様は起動後に/docsにて確認ください。( @darai0512 様によるPRです、ありがとうございます
  • 学習時に自動的にデフォルトスタイル Neutral を生成するように。特にスタイル指定が必要のない方は、学習したらそのまま音声合成を試せます。これまで通りスタイルを自分で作ることもできます。
  • マージ機能の新規追加: Merge.bat, webui_merge.py
  • 前処理のリサンプリング時に音声ファイルの開始・終了部分の無音を削除するオプションを追加(デフォルトでオン)
  • スタイルテキスト (style text)がスタイル指定と紛らわしかったので、アシストテキスト (assist text)に変更
  • その他コードのリファクタリング

v1.1 (2023-12-29)

  • TrainとDatasetのWebUIの改良・調整一括事前処理ボタン等
  • 前処理のリサンプリング時に音量を正規化するオプションを追加(デフォルトでオン)

v1.0 (2023-12-27)

  • 初版