跳转至

中文技术文档符号与引用规范

何时加载

  • 编辑或生成同时包含中文、英文、Markdown 和代码的技术文档。
  • 用户反馈引号、反引号或代码边界格式错误时。

符号定义

  • ASCII 直引号:"';常用于英文标点和代码字符串。
  • 中文弯引号:“”‘’;用于中文自然语言引用。
  • Markdown 反引号:`;用于行内代码和字面量。

决策优先级

  1. 先保护可执行代码、JSON/schema、URL、路径和用户要求原样保留的引用文本。
  2. 识别 Markdown 代码围栏、行内代码和代码注释边界。
  3. 在中文自然语言作用域中,把成对的直引号改为弯引号,并正确处理嵌套引用。
  4. 英文原文保持原文标点;英文标识符是否使用反引号由其是否为代码字面量决定,而不是由语言决定。
  5. 无法判断作用域时保留原文并请求澄清,不做全局替换。

正反例约束

  • 正例:# 中文注释:显示 "状态"# 中文注释:显示 “状态”;同一代码块中的 name = "status"const name = "status"、SQL 标识符和 JSON 键值保持 ASCII 语法。
  • 反例:不能把代码字符串、JSON、URL、路径、英文原句或 Markdown 行内代码中的 "/' 改成弯引号;不能因为文件是中文就全局替换。
  • 每种编程语言至少提供“该改的中文注释”和“该留的可执行字面量”成对样本,并在留出/边界集更换体裁、变量名和代码结构。

数据质量门禁

  • 合成数据先按文章体裁、作用域类型和编程语言分层,再切分 train/eval/boundary,禁止 ID 和模板组合重叠。
  • 机器门禁检查未解析变量、代码围栏、非注释代码行漂移和保护区;人工抽查每个分层的首条样本,记录在 validation/manual_audit.md
  • 任何语言类别的保护区或语法门禁失败,都应回到 Skill/数据蓝图修订后重训,不能只增加 epoch 或汇报总体平均分。

验证

  • 修改必须是最小编辑,正文事实和代码内容不变。
  • Markdown、JSON 和代码语法检查必须通过。
  • 英文原文、代码和保护区域做字节级回归。
  • 记录来源 Bad Case、适用范围、例外和验证结果。