Add anime-whisper

This commit is contained in:
litagin02
2024-11-17 16:47:37 +09:00
parent 8d476175a7
commit 9740256c87
2 changed files with 13 additions and 9 deletions

View File

@@ -177,9 +177,16 @@ def create_dataset_app() -> gr.Blocks:
value=False,
)
hf_repo_id = gr.Dropdown(
["openai/whisper", "kotoba-tech/kotoba-whisper-v1.1"],
label="HuggingFaceのWhisperモデル",
value="openai/whisper",
[
"openai/whisper-large-v3-turbo",
"openai/whisper-large-v3",
"openai/whisper-large-v2",
"kotoba-tech/kotoba-whisper-v1.1",
"kotoba-tech/kotoba-whisper-v2.1",
"litagin/anime-whisper",
],
label="HuggingFaceのWhisper repo_id",
value="openai/whisper-large-v3",
visible=False,
)
compute_type = gr.Dropdown(

View File

@@ -67,8 +67,7 @@ def transcribe_files_with_hf_whisper(
"num_beams": num_beams,
"no_repeat_ngram_size": no_repeat_ngram_size,
}
logger.info(f"generate_kwargs: {generate_kwargs}")
logger.info(f"generate_kwargs: {generate_kwargs}, loading pipeline...")
pipe = pipeline(
model=model_id,
max_new_tokens=128,
@@ -79,6 +78,7 @@ def transcribe_files_with_hf_whisper(
trust_remote_code=True,
# generate_kwargs=generate_kwargs,
)
logger.info("Loaded pipeline")
if initial_prompt is not None:
prompt_ids: torch.Tensor = pipe.tokenizer.get_prompt_ids(
initial_prompt, return_tensors="pt"
@@ -195,9 +195,6 @@ if __name__ == "__main__":
wav_rel_path = wav_file.relative_to(input_dir)
with open(output_file, "a", encoding="utf-8") as f:
f.write(f"{wav_rel_path}|{model_name}|{language_id}|{text}\n")
else:
if args.hf_repo_id == "":
model_id = f"openai/whisper-{args.model}"
else:
model_id = args.hf_repo_id
logger.info(f"Loading HF Whisper model ({model_id})")