From 5a6a594735b5b041c768f28e7e5fc709a6b77e55 Mon Sep 17 00:00:00 2001 From: litagin02 Date: Tue, 2 Jan 2024 19:30:59 +0900 Subject: [PATCH] Update ui --- webui_dataset.py | 15 +++++++++++---- webui_style_vectors.py | 11 ++++------- 2 files changed, 15 insertions(+), 11 deletions(-) diff --git a/webui_dataset.py b/webui_dataset.py index e65c356..3aeb765 100644 --- a/webui_dataset.py +++ b/webui_dataset.py @@ -27,6 +27,9 @@ def do_slice(model_name: str, min_sec: float, max_sec: float, input_dir="inputs" def do_transcribe(model_name, whisper_model, compute_type, language, initial_prompt): + if initial_prompt == "": + initial_prompt = "こんにちは。元気、ですかー?私は……ちゃんと元気だよ!" + logger.debug(f"initial_prompt: {initial_prompt}") input_dir = os.path.join("Data", model_name, "raw") output_file = os.path.join("Data", model_name, "esd.list") result = run_script_with_log( @@ -45,7 +48,7 @@ def do_transcribe(model_name, whisper_model, compute_type, language, initial_pro "--language", language, "--initial_prompt", - initial_prompt, + '"initial_prompt"', ] ) return "音声の文字起こしが完了しました。" @@ -89,8 +92,9 @@ with gr.Blocks(theme="NoCrypt/miku") as app: result1 = gr.Textbox(label="結果") with gr.Row(): with gr.Column(): - whisper_model = gr.Radio( + whisper_model = gr.Dropdown( ["tiny", "base", "small", "medium", "large", "large-v2", "large-v3"], + label="Whisperモデル", value="large-v3", ) compute_type = gr.Dropdown( @@ -104,10 +108,13 @@ with gr.Blocks(theme="NoCrypt/miku") as app: "bfloat16", "float32", ], + label="計算精度", value="bfloat16", ) - language = gr.Dropdown(["ja", "en", "zh"], value="ja") - initial_prompt = gr.Textbox(label="初期プロンプトを入力してください(省略可)") + language = gr.Dropdown(["ja", "en", "zh"], value="ja", label="言語") + initial_prompt = gr.Textbox( + label="初期プロンプト(日本語の場合は省略可)", placeholder="こんにちは。元気、ですかー?私は……ちゃんと元気だよ!" + ) transcribe_button = gr.Button("音声の文字起こし") result2 = gr.Textbox(label="結果") slice_button.click( diff --git a/webui_style_vectors.py b/webui_style_vectors.py index 7635a6b..4f06020 100644 --- a/webui_style_vectors.py +++ b/webui_style_vectors.py @@ -24,12 +24,11 @@ centroids = [] def load(model_name): global wav_files, x, x_tsne, mean wavs_dir = os.path.join("Data", model_name, "wavs") - wav_files = [ - os.path.join(wavs_dir, wav_path) - for wav_path in os.listdir(wavs_dir) - if wav_path.endswith(".wav") + style_vector_files = [ + os.path.join(wavs_dir, f) for f in os.listdir(wavs_dir) if f.endswith(".npy") ] - style_vectors = [np.load(f"{wav_path}.npy") for wav_path in wav_files] + wav_files = [f.replace(".npy", "") for f in style_vector_files] + style_vectors = [np.load(f) for f in style_vector_files] x = np.array(style_vectors) mean = np.mean(x, axis=0) @@ -166,8 +165,6 @@ def save_style_vectors_from_files(model_name, audio_files_text, style_names_text style_vectors.append(np.load(f"{path}.npy")) style_vectors = np.stack(style_vectors) style_vector_path = os.path.join(result_dir, "style_vectors.npy") - if os.path.exists(style_vector_path): - return f"{style_vector_path}が既に存在します。削除するか別の名前にバックアップしてください。" np.save(style_vector_path, style_vectors) # config.jsonの更新