Fix: The conversion script for English BERT to Fast Tokenizer was incorrect, so tokenization was not performed correctly

This commit is contained in:
tsukumi
2024-12-19 11:10:33 +09:00
parent c1fce3fec7
commit 2833fb5eeb
6 changed files with 1024100 additions and 256046 deletions

View File

@@ -6,9 +6,9 @@
"normalizer": {
"type": "BertNormalizer",
"clean_text": true,
"handle_chinese_chars": false,
"strip_accents": false,
"lowercase": false
"handle_chinese_chars": true,
"strip_accents": null,
"lowercase": true
},
"pre_tokenizer": {
"type": "BertPreTokenizer"

View File

@@ -6,9 +6,9 @@
"normalizer": {
"type": "BertNormalizer",
"clean_text": true,
"handle_chinese_chars": false,
"strip_accents": false,
"lowercase": false
"handle_chinese_chars": true,
"strip_accents": null,
"lowercase": true
},
"pre_tokenizer": {
"type": "BertPreTokenizer"

File diff suppressed because one or more lines are too long

File diff suppressed because one or more lines are too long