Fix: The conversion script for English BERT to Fast Tokenizer was incorrect, so tokenization was not performed correctly
This commit is contained in:
@@ -6,9 +6,9 @@
|
||||
"normalizer": {
|
||||
"type": "BertNormalizer",
|
||||
"clean_text": true,
|
||||
"handle_chinese_chars": false,
|
||||
"strip_accents": false,
|
||||
"lowercase": false
|
||||
"handle_chinese_chars": true,
|
||||
"strip_accents": null,
|
||||
"lowercase": true
|
||||
},
|
||||
"pre_tokenizer": {
|
||||
"type": "BertPreTokenizer"
|
||||
|
||||
@@ -6,9 +6,9 @@
|
||||
"normalizer": {
|
||||
"type": "BertNormalizer",
|
||||
"clean_text": true,
|
||||
"handle_chinese_chars": false,
|
||||
"strip_accents": false,
|
||||
"lowercase": false
|
||||
"handle_chinese_chars": true,
|
||||
"strip_accents": null,
|
||||
"lowercase": true
|
||||
},
|
||||
"pre_tokenizer": {
|
||||
"type": "BertPreTokenizer"
|
||||
|
||||
File diff suppressed because one or more lines are too long
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user