From 3705de9087ca7984077abce7a58df1fd042cffee Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?=E5=8D=97=E6=A0=96?= <76865636+Minami-su@users.noreply.github.com> Date: Sat, 4 Nov 2023 16:47:46 +0800 Subject: [PATCH] =?UTF-8?q?=E4=BF=AE=E5=A4=8D=E9=83=A8=E5=88=86=E6=97=A5?= =?UTF-8?q?=E6=96=87=E6=B1=89=E5=AD=97=E6=97=A0=E6=B3=95=E8=A2=AB=E6=8E=A8?= =?UTF-8?q?=E7=90=86/=E8=AE=AD=E7=BB=83=20(#148)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit * Update japanese.py * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> --- text/japanese.py | 9 +++++++++ 1 file changed, 9 insertions(+) diff --git a/text/japanese.py b/text/japanese.py index 31cdf45..dde314d 100644 --- a/text/japanese.py +++ b/text/japanese.py @@ -361,7 +361,16 @@ def align_tones(phones, tones): return res +import pykakasi + +kks = pykakasi.kakasi() + + def g2p(norm_text): + result = kks.convert(norm_text) + norm_text = "" + for i in result: + norm_text += i["hira"] sep_text, sep_kata, acc = text2sep_kata(norm_text) sep_tokenized = [tokenizer.tokenize(i) for i in sep_text] sep_phonemes = handle_long([kata2phoneme(i) for i in sep_kata])