fix #6499

2026-03-10 13:56:00 +08:00 · 2025-01-02 11:17:29 +00:00
parent f8e80d566f
commit 1800f8c72d
5 changed files with 17 additions and 27 deletions
--- a/src/llamafactory/data/processors/pretrain.py
+++ b/src/llamafactory/data/processors/pretrain.py
@@ -52,3 +52,8 @@ def preprocess_pretrain_dataset(
                result["input_ids"][i][0] = tokenizer.bos_token_id

    return result
+
+
+def print_pretrain_dataset_example(example: Dict[str, List[int]], tokenizer: "PreTrainedTokenizer") -> None:
+    print("input_ids:\n{}".format(example["input_ids"]))
+    print("inputs:\n{}".format(tokenizer.decode(example["input_ids"], skip_special_tokens=False)))