Format and docs

This commit is contained in:
litagin02
2024-02-26 01:05:05 +09:00
parent e7d4218504
commit 36462c8203
7 changed files with 44 additions and 7 deletions

View File

@@ -1,6 +1,7 @@
""" """
logger封装 logger封装
""" """
from loguru import logger from loguru import logger
from .stdout_wrapper import SAFE_STDOUT from .stdout_wrapper import SAFE_STDOUT

View File

@@ -5,9 +5,15 @@
### 大きな変更 ### 大きな変更
#### ユーザー辞書機能 #### ユーザー辞書機能
あらかじめ辞書に固有名詞を追加することができ、それが学習時・音声合成時の読み取得部分に適応されます。辞書の追加・編集は次のエディタ経由で行ってください。 あらかじめ辞書に固有名詞を追加することができ、それが学習時・音声合成時の読み取得部分に適応されます。辞書の追加・編集は次のエディタ経由で行ってください。または、手持ちのOpenJTalkのcsv形式の辞書がある場合は、`dict_data/default.csv`ファイルを直接上書きや追加しても可能です。
辞書部分の[実装](/text/user_dict/) は、中のREADMEにある通り、[VOICEVOX Editor](https://github.com/VOICEVOX/voicevox) のものを使っており、この部分のコードライセンスはLGPL-3. 使えそうな辞書(ライセンス等は各自ご確認ください)(他に良いのがあったら教えて下さい):
- [WariHima/Kanayomi-dict](https://github.com/WariHima/KanaYomi-dict)
- [takana-v/tsumu_dic](https://github.com/takana-v/tsumu_dic)
辞書機能部分の[実装](/text/user_dict/) は、中のREADMEにある通り、[VOICEVOX Editor](https://github.com/VOICEVOX/voicevox) のものを使っており、この部分のコードライセンスはLGPL-3.0です。
#### 音声合成専用エディタ #### 音声合成専用エディタ
@@ -18,9 +24,27 @@
`Editor.bat`をダブルクリックか`python server_editor.py --inbrowser`で起動します。エディター部分は[こちらの別リポジトリ](https://github.com/litagin02/Style-Bert-VITS2-Editor)になります。フロントエンド初心者なのでプルリクや改善案等をお待ちしています。 `Editor.bat`をダブルクリックか`python server_editor.py --inbrowser`で起動します。エディター部分は[こちらの別リポジトリ](https://github.com/litagin02/Style-Bert-VITS2-Editor)になります。フロントエンド初心者なのでプルリクや改善案等をお待ちしています。
### バグ修正
- 「うっうあ」等の特定の状況で読みが正しく取得できないバグの修正
- 前処理時に、書き起こしファイルのある行の形式が不正だと、書き起こしファイルのそれ以降の内容が消えてしまうバグの修正
- faster-whisperが1.0.0にメジャーバージョンアップされ今のところ大幅に劣化したので、バージョンを0.10.1へ固定
### 改善 ### 改善
- テキスト前処理時に、読みの取得の失敗等があった場合に、処理を中断せず、エラーがおきた箇所を`text_error.log`ファイルへ保存するように変更。
- 音声合成時に、読めない文字があったときはエラーを起こさず、その部分を無視して読み上げるように変更(学習段階ではエラーを出します)
- コマンドラインで前処理や学習が簡単にできるよう、前処理を行う`preprocess_all.py`を追加(詳しくは[CLI.md](/docs/CLI.md)を参照)
- 学習の際に、自動的に自分のhugging faceリポジトリへ結果をアップロードするオプションを追加。コマンドライン引数で`--repo_id username/my_model`のように指定してください(詳しくは[CLI.md](/docs/CLI.md)を参照)。🤗の無制限ストレージが使えるのでクラウドでの学習に便利です。
- 学習時にデコーダー部分を凍結するオプションの追加。品質がもしかしたら上がるかもしれません。 - 学習時にデコーダー部分を凍結するオプションの追加。品質がもしかしたら上がるかもしれません。
- - `initialize.py`に引数`--dataset_root``--assets_root`を追加し、`configs/paths.yml`を変更できるようにした
### その他
- [paperspaceでの学習の手引きを追加](/docs/paperspace.md)、paperspaceでのimageに使える[Dockerfile](/Dockerfile.train)を追加
- [CLIでの学習の仕方を追加](/docs/CLI.md)
- [Hugging Face spacesで遊べる音声合成エディタ](https://huggingface.co/spaces/litagin/Style-Bert-VITS2-Editor-Demo)をデプロイするための[Dockerfile](Dockerfile.deploy)を追加
## v2.2 (2024-02-09) ## v2.2 (2024-02-09)

View File

@@ -497,7 +497,10 @@ class ToneSandhi:
# 个做量词 # 个做量词
elif ( elif (
ge_idx >= 1 ge_idx >= 1
and (word[ge_idx - 1].isnumeric() or word[ge_idx - 1] in "几有两半多各整每做是") and (
word[ge_idx - 1].isnumeric()
or word[ge_idx - 1] in "几有两半多各整每做是"
)
) or word == "": ) or word == "":
finals[ge_idx] = finals[ge_idx][:-1] + "5" finals[ge_idx] = finals[ge_idx][:-1] + "5"
else: else:

View File

@@ -1,10 +1,12 @@
このフォルダに含まれるユーザー辞書関連のコードは、[VOICEVOX engine](https://github.com/VOICEVOX/voicevox_engine)プロジェクトのコードを改変したものを使用しています。VOICEVOXプロジェクトのチームに深く感謝し、その貢献を尊重します。 このフォルダに含まれるユーザー辞書関連のコードは、[VOICEVOX engine](https://github.com/VOICEVOX/voicevox_engine)プロジェクトのコードを改変したものを使用しています。VOICEVOXプロジェクトのチームに深く感謝し、その貢献を尊重します。
**元のコード**: **元のコード**:
- [voicevox_engine/user_dict](https://github.com/VOICEVOX/voicevox_engine/tree/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/user_dict)
- [voicevox_engine/user_dict/](https://github.com/VOICEVOX/voicevox_engine/tree/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/user_dict)
- [voicevox_engine/model.py](https://github.com/VOICEVOX/voicevox_engine/blob/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/model.py#L207) - [voicevox_engine/model.py](https://github.com/VOICEVOX/voicevox_engine/blob/f181411ec69812296989d9cc583826c22eec87ae/voicevox_engine/model.py#L207)
**改変の詳細**: **改変の詳細**:
- ファイル名の書き換えおよびそれに伴うimport文の書き換え。 - ファイル名の書き換えおよびそれに伴うimport文の書き換え。
- VOICEVOX固有の部分をコメントアウト。 - VOICEVOX固有の部分をコメントアウト。
- mutexを使用している部分をコメントアウト。 - mutexを使用している部分をコメントアウト。
@@ -13,4 +15,5 @@
- Pydanticのモデルで必要な箇所のみを抽出。 - Pydanticのモデルで必要な箇所のみを抽出。
**ライセンス**: **ライセンス**:
元のVOICEVOX engineのリポジトリのコードは、LGPL v3 と、ソースコードの公開が不要な別ライセンスのデュアルライセンスの下で使用されています。当プロジェクトにおけるこのモジュールもLGPLライセンスの下にあります。詳細については、プロジェクトのルートディレクトリにある[LGPL_LICENSE](/LGPL_LICENSE)ファイルをご参照ください。また、元のVOICEVOX engineプロジェクトのライセンスについては、[こちら](https://github.com/VOICEVOX/voicevox_engine/blob/master/LICENSE)をご覧ください。 元のVOICEVOX engineのリポジトリのコードは、LGPL v3 と、ソースコードの公開が不要な別ライセンスのデュアルライセンスの下で使用されています。当プロジェクトにおけるこのモジュールもLGPLライセンスの下にあります。詳細については、プロジェクトのルートディレクトリにある[LGPL_LICENSE](/LGPL_LICENSE)ファイルをご参照ください。また、元のVOICEVOX engineプロジェクトのライセンスについては、[こちら](https://github.com/VOICEVOX/voicevox_engine/blob/master/LICENSE)をご覧ください。

View File

@@ -1,6 +1,7 @@
""" """
翻译api 翻译api
""" """
from config import config from config import config
import random import random

View File

@@ -38,7 +38,9 @@ def update_c_files():
c_files.append(os.path.join(root, file)) c_files.append(os.path.join(root, file))
cnt += 1 cnt += 1
print(c_files) print(c_files)
return f"更新模型列表完成, 共找到{cnt}个配置文件", gr.Dropdown.update(choices=c_files) return f"更新模型列表完成, 共找到{cnt}个配置文件", gr.Dropdown.update(
choices=c_files
)
def update_model_folders(): def update_model_folders():
@@ -50,7 +52,9 @@ def update_model_folders():
subdirs.append(os.path.join(root, dir_name)) subdirs.append(os.path.join(root, dir_name))
cnt += 1 cnt += 1
print(subdirs) print(subdirs)
return f"更新模型文件夹列表完成, 共找到{cnt}个文件夹", gr.Dropdown.update(choices=subdirs) return f"更新模型文件夹列表完成, 共找到{cnt}个文件夹", gr.Dropdown.update(
choices=subdirs
)
def update_wav_lab_pairs(): def update_wav_lab_pairs():

View File

@@ -1,6 +1,7 @@
""" """
Original `webui.py` for Bert-VITS2, not working with Style-Bert-VITS2 yet. Original `webui.py` for Bert-VITS2, not working with Style-Bert-VITS2 yet.
""" """
# flake8: noqa: E402 # flake8: noqa: E402
import os import os
import logging import logging