diff --git a/common/log.py b/common/log.py index 51dca5f..679bb2c 100644 --- a/common/log.py +++ b/common/log.py @@ -1,6 +1,7 @@ """ logger封装 """ + from loguru import logger from .stdout_wrapper import SAFE_STDOUT diff --git a/docs/CHANGELOG.md b/docs/CHANGELOG.md index 77cdca5..bbf1159 100644 --- a/docs/CHANGELOG.md +++ b/docs/CHANGELOG.md @@ -5,9 +5,15 @@ ### 大きな変更 #### ユーザー辞書機能 -あらかじめ辞書に固有名詞を追加することができ、それが学習時・音声合成時の読み取得部分に適応されます。辞書の追加・編集は次のエディタ経由で行ってください。 +あらかじめ辞書に固有名詞を追加することができ、それが学習時・音声合成時の読み取得部分に適応されます。辞書の追加・編集は次のエディタ経由で行ってください。または、手持ちのOpenJTalkのcsv形式の辞書がある場合は、`dict_data/default.csv`ファイルを直接上書きや追加しても可能です。 -辞書部分の[実装](/text/user_dict/) は、中のREADMEにある通り、[VOICEVOX Editor](https://github.com/VOICEVOX/voicevox) のものを使っており、この部分のコードライセンスはLGPL-3. +使えそうな辞書(ライセンス等は各自ご確認ください)(他に良いのがあったら教えて下さい): + +- [WariHima/Kanayomi-dict](https://github.com/WariHima/KanaYomi-dict) +- [takana-v/tsumu_dic](https://github.com/takana-v/tsumu_dic) + + +辞書機能部分の[実装](/text/user_dict/) は、中のREADMEにある通り、[VOICEVOX Editor](https://github.com/VOICEVOX/voicevox) のものを使っており、この部分のコードライセンスはLGPL-3.0です。 #### 音声合成専用エディタ @@ -18,9 +24,27 @@ `Editor.bat`をダブルクリックか`python server_editor.py --inbrowser`で起動します。エディター部分は[こちらの別リポジトリ](https://github.com/litagin02/Style-Bert-VITS2-Editor)になります。フロントエンド初心者なのでプルリクや改善案等をお待ちしています。 +### バグ修正 + +- 「うっうあ」等の特定の状況で読みが正しく取得できないバグの修正 +- 前処理時に、書き起こしファイルのある行の形式が不正だと、書き起こしファイルのそれ以降の内容が消えてしまうバグの修正 +- faster-whisperが1.0.0にメジャーバージョンアップされ(今のところ)大幅に劣化したので、バージョンを0.10.1へ固定 + ### 改善 + +- テキスト前処理時に、読みの取得の失敗等があった場合に、処理を中断せず、エラーがおきた箇所を`text_error.log`ファイルへ保存するように変更。 +- 音声合成時に、読めない文字があったときはエラーを起こさず、その部分を無視して読み上げるように変更(学習段階ではエラーを出します) +- コマンドラインで前処理や学習が簡単にできるよう、前処理を行う`preprocess_all.py`を追加(詳しくは[CLI.md](/docs/CLI.md)を参照) +- 学習の際に、自動的に自分のhugging faceリポジトリへ結果をアップロードするオプションを追加。コマンドライン引数で`--repo_id username/my_model`のように指定してください(詳しくは[CLI.md](/docs/CLI.md)を参照)。🤗の無制限ストレージが使えるのでクラウドでの学習に便利です。 - 学習時にデコーダー部分を凍結するオプションの追加。品質がもしかしたら上がるかもしれません。 -- +- `initialize.py`に引数`--dataset_root`と`--assets_root`を追加し、`configs/paths.yml`を変更できるようにした + +### その他 + +- [paperspaceでの学習の手引きを追加](/docs/paperspace.md)、paperspaceでのimageに使える[Dockerfile](/Dockerfile.train)を追加 +- [CLIでの学習の仕方を追加](/docs/CLI.md) +- [Hugging Face spacesで遊べる音声合成エディタ](https://huggingface.co/spaces/litagin/Style-Bert-VITS2-Editor-Demo)をデプロイするための[Dockerfile](Dockerfile.deploy)を追加 + ## v2.2 (2024-02-09) diff --git a/text/tone_sandhi.py b/text/tone_sandhi.py index 3723086..38f3137 100644 --- a/text/tone_sandhi.py +++ b/text/tone_sandhi.py @@ -497,7 +497,10 @@ class ToneSandhi: # 个做量词 elif ( ge_idx >= 1 - and (word[ge_idx - 1].isnumeric() or word[ge_idx - 1] in "几有两半多各整每做是") + and ( + word[ge_idx - 1].isnumeric() + or word[ge_idx - 1] in "几有两半多各整每做是" + ) ) or word == "个": finals[ge_idx] = finals[ge_idx][:-1] + "5" else: diff --git a/text/user_dict/README.md b/text/user_dict/README.md index b086a4d..6f5618e 100644 --- a/text/user_dict/README.md +++ b/text/user_dict/README.md @@ -1,10 +1,12 @@ このフォルダに含まれるユーザー辞書関連のコードは、[VOICEVOX engine](https://github.com/VOICEVOX/voicevox_engine)プロジェクトのコードを改変したものを使用しています。VOICEVOXプロジェクトのチームに深く感謝し、その貢献を尊重します。 **元のコード**: -- [voicevox_engine/user_dict](https://github.com/VOICEVOX/voicevox_engine/tree/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/user_dict) + +- [voicevox_engine/user_dict/](https://github.com/VOICEVOX/voicevox_engine/tree/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/user_dict) - [voicevox_engine/model.py](https://github.com/VOICEVOX/voicevox_engine/blob/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/model.py#L207) **改変の詳細**: + - ファイル名の書き換えおよびそれに伴うimport文の書き換え。 - VOICEVOX固有の部分をコメントアウト。 - mutexを使用している部分をコメントアウト。 @@ -13,4 +15,5 @@ - Pydanticのモデルで必要な箇所のみを抽出。 **ライセンス**: + 元のVOICEVOX engineのリポジトリのコードは、LGPL v3 と、ソースコードの公開が不要な別ライセンスのデュアルライセンスの下で使用されています。当プロジェクトにおけるこのモジュールもLGPLライセンスの下にあります。詳細については、プロジェクトのルートディレクトリにある[LGPL_LICENSE](/LGPL_LICENSE)ファイルをご参照ください。また、元のVOICEVOX engineプロジェクトのライセンスについては、[こちら](https://github.com/VOICEVOX/voicevox_engine/blob/master/LICENSE)をご覧ください。 diff --git a/tools/translate.py b/tools/translate.py index 9368b5f..be0f7ea 100644 --- a/tools/translate.py +++ b/tools/translate.py @@ -1,6 +1,7 @@ """ 翻译api """ + from config import config import random diff --git a/update_status.py b/update_status.py index 65b4f93..7d768c6 100644 --- a/update_status.py +++ b/update_status.py @@ -38,7 +38,9 @@ def update_c_files(): c_files.append(os.path.join(root, file)) cnt += 1 print(c_files) - return f"更新模型列表完成, 共找到{cnt}个配置文件", gr.Dropdown.update(choices=c_files) + return f"更新模型列表完成, 共找到{cnt}个配置文件", gr.Dropdown.update( + choices=c_files + ) def update_model_folders(): @@ -50,7 +52,9 @@ def update_model_folders(): subdirs.append(os.path.join(root, dir_name)) cnt += 1 print(subdirs) - return f"更新模型文件夹列表完成, 共找到{cnt}个文件夹", gr.Dropdown.update(choices=subdirs) + return f"更新模型文件夹列表完成, 共找到{cnt}个文件夹", gr.Dropdown.update( + choices=subdirs + ) def update_wav_lab_pairs(): diff --git a/webui.py b/webui.py index e7c1abd..90318a1 100644 --- a/webui.py +++ b/webui.py @@ -1,6 +1,7 @@ """ Original `webui.py` for Bert-VITS2, not working with Style-Bert-VITS2 yet. """ + # flake8: noqa: E402 import os import logging