From 537534f2bd2f4d9d01bedbdfa32733439345d584 Mon Sep 17 00:00:00 2001 From: Taksh Date: Fri, 17 Jul 2026 11:04:50 +0300 Subject: [PATCH] fix: locate secret spans by line number not find() Duplicate line content made text.find() attribute secrets to the wrong offset. Co-authored-by: Cursor --- python/dolma/taggers/code/code_taggers.py | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/python/dolma/taggers/code/code_taggers.py b/python/dolma/taggers/code/code_taggers.py index 31b57087..7607a237 100644 --- a/python/dolma/taggers/code/code_taggers.py +++ b/python/dolma/taggers/code/code_taggers.py @@ -53,7 +53,8 @@ def _extract_code_secrets(cls, text: str) -> List[Span]: line_number = secret.line_number - 1 span = secret.secret_value span_line = text_lines[line_number] - line_start = text.find(span_line) + # Index by line number — find() hits the first duplicate line content. + line_start = sum(len(l) + 1 for l in text_lines[:line_number]) start = line_start + span_line.find(span or "") end = start + len(span or "") assert text[start:end] == span