[Feature]Upgrade pure-text skills to deterministic scripts (Fixing LLM training bias in academic scanning)

Author: Shen-YukangCreated Jun 2, 2026Updated Jun 25, 2026
Labelsenhancementneeds-triage

Upgrade pure-text skills to deterministic scripts (Fixing LLM training bias in academic scanning)

目前的 colleague-skill 主要依赖纯文本(如 skill.md 或是基于自然语言的 Prompt 描述)来定义 Agent 的技能。然而,但是大语言模型(LLM)天然存在**训练偏执(Training Bias)与幻觉,纯文本定义的技能(Skills)在高频、动态或平台底层的交互场景中,表现可能出严重的缺乏实证性(Not Grounded)**和不可控性或不遵守 skill 里面 的系统提示词规程。

纯文本的技能只适合做高层规划,底层执行急需从纯文本描述升级为具备强类型、确定性的“可执行脚本(Scripts)”

Proposed solution / 建议方案

建议将技能的设计泛化为 "From Text to Script" 的混合架构,将纯文本的声明式 Skill 编译/映射为底层的结构化脚本:

  1. 硬化数据解析与学术 API 采集(Deterministic Scraping Scripts):

    • 将针对论文 PDF/XML 的解析、公式提取、以及第三方学术数据库(如 Crossref, DOI 验证)的调用彻底脚本化(使用专门的 Python/Go 库处理)。例如接入MinerU做一次 grounded 扫描,有证据梯子可以查证。
    • 屏蔽大模型在数据采集阶段的介入,确保输入给 Agent 的文献元数据(Metadata)是 100% 准确的真实数据。
  2. 结构化参数路由与算法隔离(Schema-based Algorithm Execution):

    • 大模型仅负责理解审查规则、提取待检测的线索(如语义冲突点、潜在造假假设),并输出结构化的参数(JSON Schema)
    • 真正的数值比对、文本查重、图表重复率计算交由预设好、经过严格密码学与数字图像处理验证的底层脚本(如基于 NumPy, OpenCV, Clean-text 的脚本)来确定性执行。
  3. 可复现性验证环境(Reproducible Runtime Grounding):

    • 为每个扫描技能提供一个轻量级的受控 Runtime 容器。每一次学术不端扫描的脚本执行轨迹、对比日志、中间哈希值都需要被硬编码脚本持久化记录,确保打假结果具有法律/学术层面的可复现性(Reproducibility),而非大模型的随机输出。

Would you be willing to submit a PR? / 你愿意提 PR 吗?

  • Yes, I can work on this / 我愿意
  • I can help test / 我可以帮忙测试
  • Just suggesting / 只是建议

Source: titanwings/colleague-skill