Add anime-whisper
This commit is contained in:
@@ -177,9 +177,16 @@ def create_dataset_app() -> gr.Blocks:
|
|||||||
value=False,
|
value=False,
|
||||||
)
|
)
|
||||||
hf_repo_id = gr.Dropdown(
|
hf_repo_id = gr.Dropdown(
|
||||||
["openai/whisper", "kotoba-tech/kotoba-whisper-v1.1"],
|
[
|
||||||
label="HuggingFaceのWhisperモデル",
|
"openai/whisper-large-v3-turbo",
|
||||||
value="openai/whisper",
|
"openai/whisper-large-v3",
|
||||||
|
"openai/whisper-large-v2",
|
||||||
|
"kotoba-tech/kotoba-whisper-v1.1",
|
||||||
|
"kotoba-tech/kotoba-whisper-v2.1",
|
||||||
|
"litagin/anime-whisper",
|
||||||
|
],
|
||||||
|
label="HuggingFaceのWhisper repo_id",
|
||||||
|
value="openai/whisper-large-v3",
|
||||||
visible=False,
|
visible=False,
|
||||||
)
|
)
|
||||||
compute_type = gr.Dropdown(
|
compute_type = gr.Dropdown(
|
||||||
|
|||||||
@@ -67,8 +67,7 @@ def transcribe_files_with_hf_whisper(
|
|||||||
"num_beams": num_beams,
|
"num_beams": num_beams,
|
||||||
"no_repeat_ngram_size": no_repeat_ngram_size,
|
"no_repeat_ngram_size": no_repeat_ngram_size,
|
||||||
}
|
}
|
||||||
logger.info(f"generate_kwargs: {generate_kwargs}")
|
logger.info(f"generate_kwargs: {generate_kwargs}, loading pipeline...")
|
||||||
|
|
||||||
pipe = pipeline(
|
pipe = pipeline(
|
||||||
model=model_id,
|
model=model_id,
|
||||||
max_new_tokens=128,
|
max_new_tokens=128,
|
||||||
@@ -79,6 +78,7 @@ def transcribe_files_with_hf_whisper(
|
|||||||
trust_remote_code=True,
|
trust_remote_code=True,
|
||||||
# generate_kwargs=generate_kwargs,
|
# generate_kwargs=generate_kwargs,
|
||||||
)
|
)
|
||||||
|
logger.info("Loaded pipeline")
|
||||||
if initial_prompt is not None:
|
if initial_prompt is not None:
|
||||||
prompt_ids: torch.Tensor = pipe.tokenizer.get_prompt_ids(
|
prompt_ids: torch.Tensor = pipe.tokenizer.get_prompt_ids(
|
||||||
initial_prompt, return_tensors="pt"
|
initial_prompt, return_tensors="pt"
|
||||||
@@ -195,9 +195,6 @@ if __name__ == "__main__":
|
|||||||
wav_rel_path = wav_file.relative_to(input_dir)
|
wav_rel_path = wav_file.relative_to(input_dir)
|
||||||
with open(output_file, "a", encoding="utf-8") as f:
|
with open(output_file, "a", encoding="utf-8") as f:
|
||||||
f.write(f"{wav_rel_path}|{model_name}|{language_id}|{text}\n")
|
f.write(f"{wav_rel_path}|{model_name}|{language_id}|{text}\n")
|
||||||
else:
|
|
||||||
if args.hf_repo_id == "":
|
|
||||||
model_id = f"openai/whisper-{args.model}"
|
|
||||||
else:
|
else:
|
||||||
model_id = args.hf_repo_id
|
model_id = args.hf_repo_id
|
||||||
logger.info(f"Loading HF Whisper model ({model_id})")
|
logger.info(f"Loading HF Whisper model ({model_id})")
|
||||||
|
|||||||
Reference in New Issue
Block a user