Fix: The conversion script for English BERT to Fast Tokenizer was incorrect, so tokenization was not performed correctly

This commit is contained in:
tsukumi
2024-12-19 11:10:33 +09:00
parent c1fce3fec7
commit 2833fb5eeb
6 changed files with 1024100 additions and 256046 deletions

View File

@@ -142,7 +142,7 @@ def load_tokenizer(
revision (str): モデルの Hugging Face 上の Git リビジョン。指定しない場合は最新の main ブランチの内容が利用される (デフォルト: None)
Returns:
Union[PreTrainedTokenizer, PreTrainedTokenizerFast, DebertaV2Tokenizer]: ロード済みの BERT トークナイザー
Union[PreTrainedTokenizer, PreTrainedTokenizerFast, DebertaV2TokenizerFast]: ロード済みの BERT トークナイザー
"""
# すでにロード済みの場合はそのまま返す
@@ -251,8 +251,6 @@ def unload_tokenizer(language: Languages) -> None:
language (Languages): アンロードする BERT トークナイザーの言語
"""
import torch
if language in __loaded_tokenizers:
del __loaded_tokenizers[language]
gc.collect()