小马的 AI 工具集

学术科研

面向学术研究全流程的技能套件,覆盖检索、写作、引用核查、同行评审到定稿

学术科研
类型 技能 40,571 星标 更新 2026-08-02 许可 Other 原仓库 主页

Version DOI License: CC BY-NC 4.0 Sponsor

简体中文版 | 繁體中文版 | 日本語版 | 한국어

用于学术研究的Claude Code技能综合套件,涵盖从研究到发表的完整管道。

30秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

然后尝试 /ars-plan 通过苏格拉底式对话逐步构建你的论文结构,或跳转到 快速安装 了解先决条件和传统的符号链接流程。

AI是你的副驾驶,不是主驾驶。 这个工具不会替你写论文。它处理繁琐的工作——查找参考文献、格式化引用、验证数据、检查逻辑一致性——这样你就可以专注于那些真正需要你大脑的部分:定义问题、选择方法、解释数据的含义、以及写出”I argue that”后面的句子。

与人性化工具不同,这个工具不会帮你隐藏使用AI的事实。它帮助你写得更好。Style Calibration从你过去的工作中学习你的声音。Writing Quality Check捕捉那些让散文感觉像机器生成的模式。目标是质量,而不是作弊。

为什么是人机协作,而不是完全自动化?

Lu 等人(2026, Nature 651:914-919)构建了 The AI Scientist —— 第一个完全自主的AI研究系统,通过盲审在顶级机器学习会议(ICLR 2025 workshop,得分6.33/10,而workshop平均分4.87)上发表了一篇论文。其局限性部分列举了任何完全自主的AI研究管道都会继承的失败模式:实现错误、幻觉结果、捷径依赖、将错误当作洞察的重新框架、方法捏造、框架锁定、引用幻觉。

ARS 建立在这样一个前提上:由AI增强的人类研究人员比任何单独一方都能更好地避免这些失败模式。Stage 2.5 和 Stage 4.5 的完整性门控运行一个7模式阻断检查清单(参见 academic-pipeline/references/ai_research_failure_modes.md);审阅者提供一个可选校准模式,针对用户提供的黄金标准集测量其自身的 FNR/FPR。

Zhao 等人(2026-05)审计了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献。他们保守估计,仅 2025 年就有 146,932 条幻象引用,观察到 2024 年中期的拐点;对于 bioRxiv 到 PMC 的配对,他们报告了 85.3% 的预印本到发表版本的持续率。该论文将“实际部署来支持引用文献并未实际提出的主张的引用”描述为一个开放挑战。ARS v3.7.1 添加了信任链前文用于源来源证明;v3.7.3 添加了定位基础设施(三层引用锚点),用于未来的主张级审计,并在引用时给出顾问风险信号(ARS 内部将主张忠实度差距标记为“L3”;这是 ARS 术语,不是该论文的术语)。v3.7.x 的动机来自 Zhao 等人的语料级发现;ARS 本身的语料级评估仍是未来工作。

v3.8 关闭了 L3 差距的后半部分。v3.7.3 使每个引用都带有定位锚点;v3.8 添加了一个可选审计过程(ARS_CLAIM_AUDIT=1),该过程针对每个锚点获取引用的来源,并判断主张是否实际得到支持。五个新的 HIGH-WARN 类别(主张不受支持、负面约束违规、捏造引用、无锚点、未引用约束违规)通过格式化终端硬门控拒绝输出。校准作为 20 元组黄金标准集提供,接受阈值为 FNR<0.15 + FPR<0.10;根据 v3.8 规范 §5,逐步部署计划推迟到校准后证据。

Ren 等人(2026, Self-Improvements in Modern Agentic Systems: A Survey)提供了第三个调查级锚点。其科学发现综合(§7.4)得出结论:发现代理无法轻易自行验证新颖性、正确性或可重复性,可能转而利用弱代理,必须管理跨异构工具和文献的证据,并引发治理问题——“当证据薄弱时,科学写作也可能放大错误信息。”其生成循环章节(§5.1–§5.2)将人工审计和保留的人工锚点列为自生成评估循环的实用保障措施,其历史章节(§2.2)记录了相同教训的最古老形式:Lenat 的 EURISKO 的实际成功在很大程度上依赖于用户作为外部评估信号,修剪无效的启发式漂移——该调查指出这一局限性在现代代理系统中仍然存在。ARS 引用该调查作为其人在回路立场的设计理由,而非作为人在回路管道优于自主管道的经验证明;该调查对 ARS 的可操作差异在 #539–#541 和 #547–#550 中跟踪。

v3.3 受到 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)的启发:Semantic Scholar API 验证、反泄漏协议、VLM 图形验证和分数轨迹跟踪。


架构与管道

👉 docs/ARCHITECTURE.md — 完整的管道视图:流程图、逐阶段矩阵、数据访问流、技能依赖图、质量门控和模式列表。

架构文档取代了之前这里冗长的管道描述。关于哪个阶段运行什么的一切现在都在一个地方。

快速安装

先决条件

  • Claude Code(最新版;插件打包需要较新版本)
  • 导出 ANTHROPIC_API_KEY,或在首次运行 claude 时设置
  • 可选: Pandoc 用于 DOCX,tectonic + Source Han Serif TC 用于 APA 7.0 PDF(Markdown 输出无需两者)
  • 可选(真实 Python): 核心技能(研究/写作/审阅)不需要 Python —— 它们由提示驱动。真实 Python 解释器仅在以下情况需要:PreToolUse 写作用域保护(可选的子代理加固——如果找不到真实 Python,它会干净地无操作,保护仅不活跃;核心技能不受影响),以及一些可选功能,这些功能会调用 Python(修订补丁模式、提交包验证器,以及 /ars-cache-invalidate / /ars-mark-read / /ars-unmark-read 命令)。在 Windows 上,请注意 python3 通常是一个非功能性的 Microsoft Store 占位符,而不是真实 Python;从 python.org(或通过 winget)安装 Python,以便启动器能找到真实解释器。保护启动器是一个 POSIX shell 脚本,hooks.json 通过 bash 调用它,因此在 Windows 上需要 Git Bash(与 Git for Windows 捆绑)。如果存在 Git Bash,缺失真实 Python 会干净地降级(保护无操作,静默)。如果没有 Git Bash,Claude Code 会回退到 PowerShell,它完全无法运行 .sh 启动器:保护不活跃,PreToolUse 钩子会在每次调用时记录错误,而不是静默无操作(接受的降级——保护是可选的,永远不会阻止你的写入,但钩子噪声是安装 Git Bash 前的权衡)。

插件安装(v3.7.0+,推荐):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

验证是否工作: 运行 /ars-plan 并描述你正在撰写的论文——ARS 将启动苏格拉底式对话,梳理章节结构。如需一次性测试,可尝试 /ars-lit-review "你的主题"

👉 docs/SETUP.md — 完整指南:安装 Claude Code,设置 API 密钥,可选 Pandoc/tectonic 以获得 DOCX/PDF,跨模型验证(ARS_CROSS_MODEL),以及六种安装方法(插件、项目技能、全局技能、claude.ai 项目、仓库克隆、Claude Science 导入)。

使用 Claude Science? 四个技能可直接导入:Skills → Import from GitHub,粘贴 https://github.com/Imbad0202/academic-research-skillsPreview,然后 Import 4 skills(需要本仓库 v3.14.0+——导入器会读取市场清单中的显式技能路径)。导入是时间点快照:ARS 更新后需重新导入。导入后的技能包含 ARS 方法论(研究/写作/评审协议);Claude Code 专属机制——斜杠命令、钩子、子智能体编排——不会转移。详情请参阅 docs/SETUP.md 方法 5。

使用 Codex CLI? 请安装对应的兄弟发行版:Imbad0202/academic-research-skills-codex —— 相同的工作流内容,Codex 原生打包为单个 $academic-research-suite 技能,带有 ars-* 别名。

第三方平台和集成 如果包装或托管 ARS,请参见 THIRD_PARTY.md —— 社区提交,未经维护者审查或认可。

性能与成本

👉 docs/PERFORMANCE.md —— 每种模式的 token 预算、完整流水线估算(约 4–6 美元/15,000 词论文),以及推荐的 Claude Code 设置(自动模式;可选 Agent Team)。

指南与文章


功能一览

  • Deep Research —— 13 个智能体研究团队,配备苏格拉底式引导模式、PRISMA 系统综述、意图检测、对话健康监测、可选的跨模型 DA、Semantic Scholar API 验证。
  • Academic Paper —— 12 个智能体论文写作,包含风格校准、写作质量检查、LaTeX 加固、可视化、修订辅导、引用转换、防泄漏协议和 VLM 图形验证。
  • Academic Paper Reviewer —— 7 个智能体多角度同行评审,包含 0–100 分质量评分标准(期刊适配评审人 + 3 个动态评审人 + 魔鬼代言人),让步阈值协议、攻击强度保持、可选的跨模型 DA 批评/校准、R&R 可追溯矩阵、只读约束。
  • Academic Pipeline —— 10 阶段流水线编排器,包含自适应检查点、声明验证、材料护照、可选的 repro_lock、可选的跨模型完整性验证、对话中强化和分数轨迹追踪。
  • Data Access Level Metadata(v3.3.2+)—— 每个技能声明 data_access_levelraw / redacted / verified_only);由 scripts/check_data_access_level.py 强制执行。模式改编自 Anthropic 的 automated-w2s-researcher (2026)。参见 shared/ground_truth_isolation_pattern.md
  • Task Type Annotation(v3.3.2+)—— 每个技能声明 task_typeopen-endedoutcome-gradable)。当前所有 ARS 技能均为 open-ended
  • Benchmark Report Schema(v3.3.5+)—— JSON Schema + lint 用于诚实基准比较。参见 shared/benchmark_report_pattern.md
  • Artifact Reproducibility Lockfile(v3.3.5+)—— 材料护照上的可选 repro_lock 子块。配置文档,非重放保证——LLM 输出不可字节级重现。参见 shared/artifact_reproducibility_pattern.md
  • Model Tiering(#517, v3.16+)—— 可选的 ARS_MODEL_TIERING 开关,具有两个方向:economy(执行型智能体降级为会话模型下一层,下限 Opus 类)和 quality-boost(完整性关卡和最终评审中的判断型智能体升级至前沿层)。默认未设置 = 与 #517 前行为字节级等效。参见 shared/model_tiering.md
  • Canonical Cross-Model Handoff Envelope(#527, v3.17+)—— 所有者→分发器→所有者盲检查点传输路径(#523)现在具有机器稳定的 [CROSS-MODEL-HANDOFF v1] 信封,以及规范性 Python 语法(scripts/cross_model_handoff.py)而非纯文本强制,在所有三个检查点所有者之间固定同意/分歧/格式错误结果路由。参见 shared/cross_model_verification.md §“Cross-model handoff envelope”。
  • Experiment Provenance Intake(#260)—— 材料护照上的可选 experiment_provenance[],记录学者外部运行的实验(ARS 从不运行实验),手稿声明通过 claim_intent_manifest.planned_experiment_ids[] 与之关联。完整性关卡(阶段 2.5/4.5)审计每个实验支持的声明与声明来源的匹配程度——ALIGNED / OVERSTATED / NOT_SUPPORTED_BY_PROVENANCE / PROVENANCE_INSUFFICIENT —— 不判断实验本身是否正确。一个失败关闭的 experiment_intake_declaration 使“你运行实验了吗?”成为明确的阶段 1 决策(即使是纯文献综述也声明 no_experiments_declared)。参见 shared/handoff_schemas.md §“Experiment Provenance Intake (#260)“。

展示:真实流水线输出

查看来自真实 10 阶段流水线运行的完整产物——同行评审报告、完整性验证报告和最终论文:

浏览所有流水线产物 →

产物描述
最终论文(英文)APA 7.0 格式,LaTeX 编译
最终论文(中文)中文版,APA 7.0
完整性报告——预审阶段 2.5:捕获 15 个捏造引用 + 3 个统计错误
完整性报告——最终阶段 4.5:确认零回归
同行评审第 1 轮期刊适配评审人 + 3 个评审人 + 魔鬼代言人
重新评审修订后验证
同行评审第 2 轮后续评审
对审稿人的回复逐点作者回复
发表后审计报告独立完整引用审计:发现 3 轮完整性检查遗漏的 21/68 个问题

伴生:实验代理

如果你的研究涉及在写作前运行实验(代码或人类研究),Experiment Agent 技能填补了 ARS 阶段 1(研究)与阶段 2(写作)之间的空白。

ARS 阶段 1 研究  →  研究问题简报 + 方法论蓝图

  experiment-agent     →  运行/管理实验 → 验证结果

ARS 阶段 2 写作     →  用已验证的实验结果撰写论文

功能:实时监控执行代码实验(Python、R 等),管理带有 IRB 伦理检查清单的人类研究协议,通过 11 类谬误检测解释统计数据,并验证可重复性。

如何配合使用:在阶段 1 后暂停 ARS 流水线,在单独的 experiment-agent 会话中运行实验,然后将结果(附带 Material Passport)带回 ARS 阶段 2。ARS 无需修改。设置说明见 experiment-agent README

阶段 1 摄入声明 (#260):在阶段 1,ARS 检测本次运行是否将携带实验支持的声明,并在 Material Passport 上设置一个故障关闭的 experiment_intake_declaration。如果你在外部运行了实验,学者为每个实验输入一条 experiment_provenance[] 条目(experiment_id、嵌套的 repro_lockplanned_vs_executed[]negative_results[]known_limitations[]),并将声明设为 experiments_declared;否则设为 no_experiments_declared。该声明在 #260 之后的每个 Passport 上都是必需的——即使未涉及任何实验的运行,也必须声明 no_experiments_declared,这样完整性关卡就不会因遗忘的 provenance 块而被静默绕过。experiment_id 在此摄入点被冻结;作者之后通过 planned_experiment_ids[] 引用它们。

教学侧伴生Teaching Skills 将 ARS 架构(技能组合、共享合约、分阶段关卡、Course Passport)应用于学术生活的教学侧——课程设计→授课→评估→交付→反思;其 sotl 模式将课堂探究项目交给 ARS 深度研究/学术论文进行发表阶段。


使用方式

快速开始

# 启动完整研究流水线
你:"我想写一篇关于 AI 对高等教育质量保障影响的研究论文"

# 以苏格拉底引导方式开始
你:"引导我关于教育评估中 AI 的研究"

# 在引导规划下写论文
你:"引导我写一篇关于人口下降的论文"

# 审阅现有论文
你:"审阅这篇论文"(然后提供论文)

# 检查流水线状态
你:"status"

单个技能

深度研究(8 种模式)

"研究 AI 对高等教育的影响"                              → 完整模式
"给我一个关于 X 的快速简报"                             → 快速模式
"用 PRISMA 对 X 做系统综述"                            → 系统综述模式
"引导我关于 X 的研究"                                  → 苏格拉底模式(引导)
"事实核查这些说法"                                     → 事实核查模式
"对 X 做文献综述"                                      → 文献综述模式
"以 WHY/HOW/WHAT 格式比较这些论文"                     → 三向扫描模式
"审阅这篇论文的研究质量"                                → 审阅模式

学术论文(11 种模式)

"写一篇关于 X 的论文"                                  → 完整模式
"引导我写一篇论文"                                      → 计划模式(引导)
"构建论文大纲"                                          → 仅大纲模式
"我有一份草稿,这里是审稿人意见"                        → 修订模式
"将审稿人意见解析为路线图"                              → 修订辅导模式
"为这篇论文写摘要"                                      → 仅摘要模式
"将其转化为文献综述论文"                                → 文献综述模式
"转换为 LaTeX" / "将引用转换为 IEEE"                    → 格式转换模式
"检查引用"                                              → 引用检查模式
"为 NeurIPS 生成 AI 披露声明"                           → 披露模式
"根据审稿意见审计我的答辩草稿"                          → 答辩审计模式

学术论文审稿人(6 种模式)

"审阅这篇论文"                                          → 完整模式(期刊适配审稿人 + R1/R2/R3 + 魔鬼代言人)
"快速评估这篇论文"                                      → 快速模式
"引导我改进这篇论文"                                    → 引导模式
"检查方法论"                                            → 方法论聚焦模式
"验证修订内容"                                          → 重新审阅模式
"根据我的黄金标准校准该审稿人"                          → 校准模式

学术流水线(编排器)

"我想写一篇完整的研究论文"                              → 从阶段 1 开始的完整流水线
"我已经有一篇论文,审阅它"                              → 从阶段 2.5 中间进入(先完整性)
"我收到了审稿人意见"                                    → 从阶段 4 中间进入

流水线以 阶段 6:过程总结 结束——自动生成论文创建过程记录,附带 6 维度协作质量评估(1–100 分)。

支持的语言

  • 繁体中文(繁體中文)——当用户用中文写作时默认
  • 英语——当用户用英语写作时默认
  • 学术论文的双语摘要(中文 + 英文)

使用其他语言? 苏格拉底模式(深度研究)和计划模式(学术论文)使用基于意图的激活——它们检测你请求的含义,而非特定关键词。这意味着它们无需修改即可在任何语言中工作。

不过,通用的 Trigger Keywords 部分(决定技能是否被激活)仍然列出了英语和繁体中文的关键词。如果你发现技能在你的语言中未能可靠激活,可以将你语言的关键词添加到每个 SKILL.md 文件中的 ### Trigger Keywords 部分,以提高匹配置信度。

支持的引用格式

  • APA 7.0(默认,包含中文引用规则)
  • Chicago(注释与作者-日期)
  • MLA
  • IEEE
  • Vancouver

支持的论文结构

  • IMRaD(实证研究)
  • 主题式文献综述
  • 理论分析
  • 案例研究
  • 政策简报
  • 会议论文

技能详情

各代理的职责及每个阶段的人工制品现位于 docs/ARCHITECTURE.md。版本号在此锚定,以便发布元数据保持在同一位置。

深度研究(v2.11.0)

13 代理研究团队。模式:完整、快速、审阅、文献综述、三向扫描、事实核查、苏格拉底、系统综述。完整代理名单及人工制品:见 ARCHITECTURE.md §3。

学术论文(v3.2.0)

12 代理论文写作流水线。模式:完整、计划、仅大纲、修订、修订辅导、仅摘要、文献综述、格式转换、引用检查、披露、答辩审计。输出:MD + DOCX(通过 Pandoc 可用时) + LaTeX(APA 7.0 apa7 类 / IEEE / Chicago)→ 通过 tectonic 生成 PDF。完整代理名单及各阶段职责:见 ARCHITECTURE.md §3。

Academic Paper Reviewer (v1.10.0)

7 智能体多视角评审,遵循 0–100 质量评分标准。模式:完整评审、复评审、快速评审、方法聚焦、引导评审、校准评审。决策映射: ≥80 接受,65–79 小修,50–64 大修,<50 拒稿。首轮评审小组 vs. 合同约束的复评审分派边界:参见 ARCHITECTURE.md §3 阶段 3 / 阶段 3’。

Academic Pipeline (v3.19.0)

10 阶段编排器,包含完整性验证、两阶段评审、苏格拉底式辅导及协作评估。流水线保证:每阶段均需用户确认检查点;完整性验证(阶段 2.5 + 4.5)不可跳过;R&R 可追溯性矩阵(Schema 11)独立验证作者的修改声明。v3.4 在阶段 2.5 / 4.5 增加了合规智能体(PRISMA-trAIce + RAISE)。v3.5 在每个 FULL/SLIM 检查点及流水线完成时增加了协作深度观察器collaboration_depth_agent,仅作建议,从不阻塞)。强制性的完整性门控(2.5 / 4.5)明确跳过该观察器,以免稀释合规检查。基于 Wang & Zhang (2026),IJETHE 23:11。包含智能体、工件和门控的阶段矩阵:参见 ARCHITECTURE.md §3。


v3.0 优化:我们发现 AI 的结构性限制

发生了什么

在使用 ARS 撰写一篇关于高等教育中 AI 的反思文章时,我遇到了三个结构性难题,无论怎样调整提示词都无法解决:

  1. 框架锁定:我要求 AI 与自己论文进行一场魔鬼代言人辩论。它确实做了——四轮,一轮比一轮精细。但每一轮都停留在我设定的框架内。魔鬼代言人攻击论点,从不攻击前提。它从未问过“我们讨论的问题本身对吗?”这正是 v2.7 压力测试中 31% 引用错误率的相同模式:验证 AI 和生成 AI 共享同一个认知框架。

  2. 面对反驳时的阿谀奉承:每次我质疑魔鬼代言人的攻击时,它都太快让步了。它撤回发现的速度比发起攻击的速度还快。模型的训练奖励对话和谐——因此“用户反驳了”被视为攻击有误的证据,而实际上,往往只是用户很坚持而已。

  3. 意图误判:苏格拉底式导师总是试图收敛并产出交付物(“要我把它写出来吗?”),而我还处于探索阶段。它无法区分“用户想进行深度哲学讨论”和“用户想要一个研究问题摘要”。两者看起来都像参与,但需要相反的 AI 行为。

我们做了哪些变更(v3.0)

魔鬼代言人——让步阈值协议deep-research + academic-paper-reviewer

  • 魔鬼代言人现在必须在每次回应前对反驳进行 1–5 级评分
  • 仅当评分 ≥4(反驳直接针对核心攻击并附有证据)时才允许让步
  • 评分 ≤3:坚持立场,重申原始攻击
  • 反阿谀奉承规则:不允许连续让步,跟踪让步率,每检查点后检测框架锁定

苏格拉底式导师——意图检测层deep-research

  • 在对话开始时及每 3 轮对话后,将用户意图分类为探索型或目标导向型
  • 探索型模式:禁用自动收敛,将最大轮数提升至 60,禁止“要我总结吗?”提示
  • 目标导向型模式:标准收敛行为
  • 反过早结束规则:在探索型模式下,由用户决定何时停止

苏格拉底式导师——对话健康指标deep-research

  • 每 5 轮对话进行静默自评,评估三个维度:持续同意、冲突回避、过早收敛
  • 检测到同意模式时,自动注入挑战性问题
  • 对用户不可见(防止被操纵),但日志可供会话后审查

为何重要

这些优化并不能解决 AI 的结构性限制——它们只是让限制变得可见且可管理。魔鬼代言人最终仍会在足够强的压力下让步。苏格拉底式导师仍然会有一定的收敛偏见。但现在有了明确的检查点,可以减缓阿谀奉承,迫使魔鬼代言人证明让步的合理性,并防止导师在用户准备好之前就结束对话。

更深层的启示:AI 素养不是学会把 AI 当作工具、遵守伦理规则或害怕 AI 风险。而是深入与 AI 互动,自己去发现它的结构性限制,并在过程中发现自己的思维限制。


许可证

本作品采用 CC-BY-NC 4.0 许可。

你可以自由地:

  • 分享——复制并重新分发材料
  • 改编——基于材料进行再混合、转换和创作

在以下条件下:

  • 署名——必须给出适当的署名
  • 非商业性使用——不得将材料用于商业目的

署名格式:

Based on Academic Research Skills by Cheng-I Wu
https://github.com/Imbad0202/academic-research-skills

贡献者

Cheng-I Wu(吳政宜)——作者和维护者

aspi6246 ——贡献者。v3.1 优化受 Claude-Code-Skills-for-Academics 中的模式启发:只读约束模式、反模式作为一等设计、认知框架方法(教授“如何思考”而非仅流程)、以及精益技能规模理念。

mchesbro1 ——贡献者。最初提出并起草了 academic-paper-reviewer/references/top_journals_by_field.md 中的 IS 8 大期刊篮子(Issue #5)。

cloudenochcsis ——贡献者。将 IS 部分从 Basket of 8 扩展至完整的 Senior Scholars’ Basket of 11——增加了 Decision Support SystemsInformation & ManagementInformation and OrganizationIssue #7PR #8)。来源为 AIS Senior Scholars’ List of Premier Journals

eltociear(Ikko Eltociear Ashimine)——贡献者。翻译了日语 README(README.ja-JP.md)(PR #161)。

xpfo-go(xpfo)——贡献者。翻译了简体中文 README(README.zh-CN.md)(PR #181)。

devCharlotte ——贡献者。翻译了韩语 README(README.ko-KR.md)(PR #469)。

Yaobin29 ——贡献者。在 PR #433 中提出了审稿人回复工具;deep-research three-way-scan 模式和 academic-paper rebuttal-audit 模式(源自该 PR 中的 audit 概念)在 v3.12.1 中整合自该贡献。

ktao732084-arch — 贡献者。扩展了academic-paper披露系统,加入了九个医学出版政策目标、目标特定的必需事实摄取,以及故障关闭的独立渲染(问题 #596PR #599);扩展了EQUATOR临床报告参考,加入了精简版的CARE、STARD和TRIPOD+AI指导,以及故障关闭的研究设计路由序列(问题 #594PR #601);设计并贡献了独立的中文文献解析器、API协议以及合成传输夹具套件(问题 #595PR #600)。


变更日志

v3.19.0 (2026-07-22) — 修订轮次声明漂移防护、PDF读取完整性预检、读取范围声明

新增: 三个建议性或可选完整性层,外加一个启动器修复。修订轮次声明漂移防护(#569/#570): 一个声明强度阶梯(“没有授权路线图项目,则不能沿is associated with < predicts < causes进行无声移动”)已接入修订草稿中,并新增一个建议性阶段E6,外加一个确定性数字/引用令牌守恒检查器——它们共同关闭了#390诚实声明残留的认识论和令牌两半(被触及的块内部没有保真度检查)。基线在当前前沿模型上测量(evals/heldout/revision_claim_drift/),机制形式归功于Yila-AI/sci-ssci-skillsPDF读取完整性预检(#512): 一个三信号页码交叉检查,防止截断/分页错误的PDF读取生成一个看似有效的page锚点。read_scope声明(#513): 在人类阅读账本上的可选诚实覆盖声明(full_text / sections / abstract_only / toc_only),使最终确定者的引用提升对读取范围敏感。启动器看门狗修复(#545): 移除一个管道阻塞,该阻塞在所有健康PreToolUse写范围守卫调用上阻塞了整个挂钟时间范围。套件 → v3.19.0;三个底层技能版本不变。

v3.18.0 (2026-07-18) — 自我改进调查集成:建议性质量层、风险分层声明门、跨模型评审员与裁判轨道

新增: 八个受Ren等人(2026, arXiv:2607.13104, Self-Improvements in Modern Agentic Systems: A Survey)启发的质量机制:每个子问题的范围绑定 + 阶段E范围一致性建议(#547),以及搜索限定的新颖性声明 + E5新颖性分类(#548)——均为建议性,在MANDATORY完整性检查点处按行显示;风险分层的阶段2.5声明验证(100%的HIGH-IMPACT声明 + 一个随机哨兵,将#518参考层级扩展到声明级别,#549);缓存通过接入引用验证门,并带有基于年龄的陈旧性建议 + 可选实时重新验证(#541,关闭v3.11 Delta-2前向声明);同意门控的跨模型评审员轨道——固定五席评审员小组中的一席位于第二模型家族(#540),以及重新评审裁判独立性,带有透明的裁判记录(#539);一个变形路由/门控鲁棒性评估种子集(#550),该种子集还发布了评审员技能缺失的zh-TW触发别名;以及调查本身作为第三个人在回路文献锚点(#542)。独立于调查轨道,插件安装也获得#544 SessionStart更新可用提醒(/plugin update在落后时通知;ARS_UPDATE_CHECK=0终止开关)。academic-pipeline跟踪套件至v3.18.0;其他三个技能版本不变。

v3.17.0 (2026-07-16) — 管道边界语义、规范跨模型交接信封、可执行面板检查器

修复: 两个未充分指定的管道边界已关闭(#528)——阶段5的“在最终确定前:始终MANDATORY”现在明确命名一个检查点(阶段4.5 PASS与阶段5调度之间的入口门),阶段6获得一个定义明确的终端确认词汇表(finish/end/done/confirm)以及一个显式的拒绝路径;所有五个管道表面现在携带全文件sha256内容锁(#529),因此任何进一步的提示表面漂移将在同一提交中哈希更新之前导致CI失败。盲检查点传输移至调度层(#523)——桶A检查点拥有者被告知自行执行跨模型传输,这在运行时Bash禁止下无法执行;调度层现在拥有传输调用。新增: 一个规范化的[CROSS-MODEL-HANDOFF v1]信封 + 规范性Python语法(#527)取代了仅散文式执行的所有者→调度器→所有者传输路径,在所有三个检查点拥有者之间固定了同意/分歧/畸变结果路由。针对#514工具允许列表的defrift锁(#524, 74个突变测试)关闭了漂移路径,即代理与其镜像的对称编辑可能静默重新添加Bash。一个可执行的冲刺合约面板检查器(#510)从主要工件重新计算两个v3.6.2决策层,并捕获多数投票公式中的转录错误。一个机器可读的降级注册表(#511 Part A)索引了套件中每个优雅降级机制,加上一个针对引用验证门的密封传输夹具集成测试(#511 Part B),针对检入的合成API主体端到端地运行所有四个解析器客户端。academic-pipeline跟踪套件至v3.17.0;其他三个技能版本不变。

v3.16.0 (2026-07-12) — 模型分层、跨模型门强化、WP研究问题建议锐化

新增: 可选模型分层(#517)——一个新的ARS_MODEL_TIERING开关,有两个方向(economy将13个执行类型代理调度到会话模型以下一个层级,地板为Opus-class;quality-boost将完整性门和最终审查界面处的判断类型代理提升到前沿层级);默认未设置保持字节等效,冻结的39代理分类由新的清单+lint固定。跨模型门强化(#518)——风险分层验证采样(HIGH-IMPACT参考文献在两个门处100%验证),在两次不可逆决策(设计冻结 + 最终编辑决定)处设置盲分歧检查点,验证器模型id的id状态白名单,以及提升烘焙协议;曾经计划中的通用第六评审员已被废弃,而非推迟。GPT-5.6 Sol列为一个临时跨模型验证器,带有显式推理努力控制(#515)。由devCharlotte提供的韩语触发关键词 + 路由边界夹具(#452/#509)。一个CARS引言修辞 + 标题创作参考,用于论文写作器(#500)。更改: WP研究问题建议通过名词互换测试(#501)和增强的豁免条款(捕获装饰标题形式外壳,#505)泛化到其20个外壳表格之外——遗漏率从0.34–0.38降至0.094,虚警0/16保持不变;评审员校准协议现在记录了LLM作为裁判的宽容方向(FARS锚点,#484);OpenAlex API密钥认证 + 预算感知的429处理 + arXiv ToU对齐退避(#495/#496)。文档: THIRD_PARTY.md社区目录(#497/#498)。academic-pipeline跟踪套件至v3.16.0;其他三个技能版本不变。

v3.15.0 (2026-07-04) — 发布门控强化、提示债务退休第二轮、去碎片锁定

一个专注于发布纪律与卫生的版本;无技能行为变更。新增: 三个 CI 门控——CHANGELOG 覆盖合并的预打标门控 (#483)、版本一致性不变量 9-11 加上打标时重新运行门控 (#487)、以及一个命令不变量门控,将 SessionStart 公告列表固定为实际的 16 命令清单 (#486)——外加两个去碎片锁定:Phase Boundary 执行语句在所有 23 个 Bucket A 智能体块中逐字固定,并且 SETUP 跨模型示例相互固定并与规范模型表固定 (#491 → #492)。变更: 提示债务退休第二轮对第一轮推迟的 17 个智能体进行深度扫描 (#489 → #490):修复了 socratic_mentor 两个智能体中的两个实时自相矛盾(过时的 15 轮退出规则与文档中典型的 20-30 轮运行),在 29 个表面修复了仓库范围内过时的执行状态语句,在 7 个智能体中修剪了 few-shot 和重复流程脚手架——通过 4 批并行审计 + 独立法典跨模型挑战验证;审计报告位于 audits/修复: 来自 shields.io 的 DOI 徽章 (#482)。academic-pipeline 跟踪该套件至 v3.15.0;其他三个技能版本不变。

v3.14.0 (2026-07-02) — Claude Science 可导入性、评估评论渲染、提示债务退休

一个可移植性与打磨版本;无技能行为变更。新增: Claude Science 可导入性——市场清单声明了显式技能路径,因此无法遍历符号链接 skills/ 目录(Claude Science “从 GitHub 导入”,Windows 检出)的 GitHub-API 导入器现在可以找到所有四个技能;在 Claude Science 上进行了端到端验证,README + SETUP 中有导入指南 (#480)。评估工具 PR 评论以一行结论 + 每个任务的表格形式呈现,原始 JSON 折叠在 <details> 中,取代了原始报告转储——仅显示层,门控逻辑字节级一致 (#479)。变更: 在 2026-07 工具退役审计后,从四个写作界面的智能体中移除了过期的写作工具脚手架 (#476/#477 → #478,净减少 111 行提示);一个提醒但不阻止的平台端口提醒,当 PR 添加新的顶级目录时显示平台端口策略 (#473)。文档: 由 devCharlotte 进行的母语审核韩文 README (#469/#471);GitHub Copilot 仓库说明 (#465);推荐自动权限模式而非跳过权限 (#464)。累积的 [Unreleased] 积压(16 个条目,其代码在 v3.13.0 标签之前已发布——diff/patch 修订模式 #390、提交包验证器 #394、评估黄金集 #215/#216 等)已纳入版本记录;见 CHANGELOG.mdacademic-pipeline 跟踪该套件至 v3.14.0;其他三个技能版本不变。

v3.13.0 (2026-06-18) — 钩子可移植性、提供商无关的验证、守卫正确性

一个次要版本,强化了安装/运行时表面并扩展了跨模型覆盖范围。修复: 写入范围守卫不再在 git 克隆 + 符号链接安装布局下误拒用户自己的 CLAUDE.md(#459,关闭了 #448/#449 的剩余一半——CLAUDE.md 是文档,而非承重强制文件,因此它离开基础设施保护列表,同时所有承重文件保持受保护);Windows Python 钩子可移植性 + 通过跨平台 hooks/run_guard.sh 启动器实现优雅的无 Python 降级,该启动器拒绝 0 字节的 Microsoft Store python3 存根,并且从不向钩子日志发送垃圾信息 (#454);draft_writer 双阶段静态联合已文档化,并支持 POSIX 安全的 Windows 路径匹配 (#451)。新增: 提供商无关的跨模型验证,接受 OpenAI 兼容端点(MiMo、DeepSeek、自托管)以及基于实体的第一方 OpenAI,后者永远不会被静默降级 (#455);一个可选的苏格拉底相邻框架探测(借用 STORM 的视角扩展,ARS_SOCRATIC_ADJACENT_PROBE=1,默认关闭,仅散文层——deep-research 2.10.0 → 2.11.0)(#461)。academic-pipeline 跟踪该套件至 v3.13.0;academic-paperacademic-paper-reviewer 不变。详见每个问题的 CHANGELOG.md

v3.12.1 (2026-06-15) — 审稿人回复分类模式(PR #433 集成)

一个补丁版本,根据 ARS 的基于模式架构,将外部贡献中真正新颖的部分作为模式集成到现有技能中。新模式: deep-researchthree-way-scan——一种轻量级的 WHY/HOW/WHAT 论文比较分类,介于 quicklit-review 之间,包含每篇论文的候选列表 + 跨论文综合(deep-research 2.9.4 → 2.10.0);academic-paperrebuttal-audit——对作者现有的反驳/回复草稿进行独立咨询性 QA,对照审稿人评论(每评论覆盖表 + 差距列表 + 语气/证据/误读风险标记),独立运行时不会生成任何内容,并显式抑制 Schema 11 / Material Passport 写入 / ready_to_submit(由带有变异覆盖的 check_rebuttal_audit_guard() 检查强制执行);另外 revision-coach 范围扩展至推回/分歧姿态和非期刊范围,以及 /ars-3w + /ars-rebuttal-audit 斜杠命令。根据输入形状路由:审稿人评论 + 草稿 → rebuttal-audit;仅评论 → revision-coach。集成自 @Yaobin29PR #433。套件模式计数从 25 增加到 27(仍为 4 个技能)。详见每个问题的 CHANGELOG.md

v3.12.0 (2026-06-08) — Kong 自动研究特性轨道:实验来源、图表保真度、跨论文矛盾、部分证据分解

一个次要版本,发布了 Kong et al. (2026, arXiv:2605.18661) 自动研究特性轨道以及部分证据陷阱分解工作,每个都独立审查并合并。新特性: 实验来源摄入 + 声明→实验对齐——一个基于模式的证据账本层,用于实验支持的声明,仅摄入和对齐(学者在外部运行实验;ARS 从不执行它们)(#260);一个图形/表格保真度门控,检查标题的解释是否从数据中得出,以及手稿是否引用该工件来支持其声明 (#261);一个结构化的跨论文矛盾清单,使评估的论文对可枚举以供学者确认 (#262);以及在引用判断器 (#213) 和编辑综合器 (#214) 中在判断前进行子声明分解,关闭了两层上的 §F.3.2 部分证据陷阱。指导 + 解释层: 在生成报告的审稿人中强化简洁输出 + 压力稳定边界 (#274);一个同族 / 基于标准的校准认知注释 (#273);检索内容指令/数据边界作为常设原则陈述 (#367)。负范围: Kong META (#255) 以 POSITIONING.md 中的 “Rejected mechanisms” 部分结束,列举了 ARS 不做的五个自主机制,加上两个 Tier D 设计教训文档。发布纪律检查: 版本一致性不变量 5–7 (#357) 和 ARCHITECTURE 组件版本监管 (#345)。以及跨模型接地守卫 (#346 / #349 / #351)、引用门控缓存键和理由边界 (#359 / #360 / #361)、评估黄金集 (#250) 和 ACL/EMNLP 披露重新接地 (#242) 的正确性修复。新的模式、清单字段和所有不变量都是可加且向后兼容的。academic-pipeline 跟踪该套件至 v3.12.0;其他三个技能版本不变。详见每个问题的 CHANGELOG.md

v3.11.1 (2026-06-06) — 发布后正确性、加固与溯源汇总

此补丁版本汇总了 v3.11.0 之后出现的发布后修复,每个修复均经过独立审查与合并:跨模型同意门扩展到完整性验证与协作深度路径 (#322)、每个条目的 OpenAlex + Crossref 回填并行化 (#138),以及七项涉及引用存在性门、v3.10 策略层、评估框架、领域证据画像以及 #310 安全边界边缘情况的正确性/加固修复 (#323 / #327 / #328 / #329 / #331 / #332 / #333) —— 其中包括两个 P1 修复(#327 无交接路径上的领域画像激活, #328 评估框架的每类阈值门)。无新功能,无破坏性模式变更。详见 CHANGELOG.md

v3.11.0 (2026-06-04) — 确定性引用验证门 (#182)

新增一个确定性引用存在性验证门,独立于 LLM 同行评审运行。每个被引参考文献最多与四个书目索引交叉核对——Semantic Scholar + OpenAlex + Crossref + 新增的 arXiv 解析器scripts/arxiv_client.py,无需 API 密钥)——并将每个引用的 lookup_verified 状态({true, false, unresolvable})写入统一摘要,因此通过查找即可捕获那些具有可证明虚假 DOI/arXiv ID 的编造引用,而无需等待评审代理注意到。该门继承 v3.10 的 terminal_policies 选择加入模型:检测始终运行,但 lookup_verified == false 的行仅在用户选择加入 terminal_policies.citation_existence == strict 时才是终结性的——默认行为是建议性的,可通过 /ars-mark-read 确认。false 被限定为ID 键不匹配(即 DOI/arXiv 查找明确失败),因此合法但未被索引的人文/非英语/地区引用保持 unresolvable 状态,永远不会阻塞(这是文档中记录的精确度优先于召回率的权衡)。附带持久化 SQLite 验证缓存(~/.cache/ars/verification.db,90 天 TTL)和 /ars-cache-invalidate 命令、独立的 verification_gate API + verify_passport.py CLI,以及 v3.9.0 污染三角测量矩阵的四索引扩展(k=0..4,均为建议性)。academic-pipeline 跟踪 v3.11.0 套件;其他三个技能版本不变。规范文档:docs/design/2026-05-21-v3.10-182-promote-citation-gate-spec.md(§0 修正案 + C-V6)。

v3.10.0 (2026-06-01) — 三角测量策略层、Kong 调查采纳、评估框架、限定写入守卫

次要版本,包含:选择加入的污染三角测量终结策略层(#127 —— 默认引用行为与 v3.9.0 字节级等效);Kong 等人 2026 年调查采纳——反驳承诺分类账(#256/#266/#268/#269)和学科相关的领域证据画像(#259);v3.10 测量基础设施——通用评估黄金集 + 排序提升 CI 门(#184);限定写入守卫 MVP(#134)——一个确定性 PreToolUse 钩子,将 23 个单阶段代理限制在其各自的阶段目录中,并禁止 Bash(改为使用 Grep/Glob 和结构化编辑工具);/ars-mark-read 插件命令(#190)及到货即损修复(#195);简体中文版 README(#185);以及 CI 加固(#156/#155)。academic-paper → v3.2.0,academic-paper-reviewer → v1.10.0,以支持承诺分类账和领域画像新增;academic-pipeline 跟踪 v3.10.0 套件。除非选择加入严格策略模式,否则默认技能行为不变;唯一的默认开启变更是 #134 守卫,它约束了受限制的子代理,而非面向用户的输出。

v3.9.4.2 (2026-05-19) — PR #149 CI 纪律门(codex 发布后)的发布后热修复

对 PR #149(7 个 CI 纪律门)的 codex 发布后审查发现了 4 个 P2 发现;v3.9.4.2 加固了其中 3 个。F1:harness-retirement-monthly.yml 添加了 GH_REPO,使得定时运行拥有仓库上下文以执行 gh issue create。F2:release-cooldown.ymlPREV_TAG 查找过滤为 v* 标签,以防止非发布标签绕过冷却期。F3:release-cooldown.yml 现在也读取注解标签的主题,并接受 hot-fix 拼写(v3.9.2 之前是一个假阴性热修复)。PR #157 后续:[skip-cooldown] 覆盖现在同时从提交消息和注解标签消息中读取(自举修复——此标签的冷却绕过证明了 F2+F3 端到端工作)。F4(测试计数单调性加固)被回退,因为它暴露了预先存在的 scripts/ 包问题,已跟踪为 #154(后来由 PR #158 修复)+ 重试 #155。关闭 #152。后续:#155, #156。

v3.9.4.1 (2026-05-19) — v3.9.4 时间验证(#135 codex 发布后)的发布后热修复

对 v3.9.4 的 codex 发布后审查发现了 4 个真实漏洞,这些漏洞被每个任务的子代理评审者遗漏。热修复补丁全部修复了这 4 个漏洞:(1) audit() 现在将 citation_provenance 连接到 P2 和 P4——当引用别名具有 confidence: lowconflict 时,验证器会发出 TEMPORAL-METADATA-MISSING,而不是将时间线日期作为真实数据使用(规范 §3.4 第一方安全检查已损坏)。(2) _date_to_interval 解析所有符合模式的有效日期形状,包括 YYYY-MM(Crossref 月份精度)和 YYYY-MM-DD..YYYY-MM-DD(区间);v3.9.4 对这些格式静默地 ValueError 并跳过了检查。(3) P4 现在在缺少引用标记时绑定直接日期捕获——像“2026 年政策启用了 2020 年推广”这样的句子现在实际触发。(4) citation_provenance.schema.jsonconfidence:high allOf 现在除了要求非空外,还要求存在(then.required),从而关闭了属性缺失的绕过。1561 个测试通过(与 v3.9.4 基线相比新增 12 个测试,0 回归)。ARCHITECTURE.md 已更新至当前状态(之前停留在 v3.8.0)。

v3.9.4 (2026-05-18) — 时间验证层(建议性)

在阶段 4 → 5 边界处新增确定性建议性验证器,涵盖 5 种时间故障模式(P1 回顾性算术、P2 年代错误引用、P3 比较器未具体化、P4 因果倒置、P5 指示性现在)。新的阶段 2 兄弟 timeline_extraction_agent 拥有 phase2_investigation/timeline.yaml + phase2_investigation/citation_provenance.yaml。验证器脚本 scripts/temporal_integrity_audit.py 确定性运行 5 遍。在 report_compiler_agent + draft_writer_agent 中添加了 M3 时间完整性铁律。M6-最小:Crossref issued + pdftotext 覆盖第一方验证。M7-最小:日期来源 + 比较器具体化。M5-存根:仅用户声明的 version_family_id。对 literature_corpus_entryclaim_audit_resultclaim_intent_manifest 零修改。bibliography_agent 未修改(F2 不变)。3 个新的侧车模式。覆盖率估计:基线 55-70% / 使用 M7 最小为 65-75%。1549 个测试通过(新增 44 个,0 回归)。

v3.9.3 (2026-05-18) — 维护(共享客户端工具 + 去重解析器)

纯重构 + 来自 v3.9.0 /simplify 审查积压的一个潜伏错误修复。提取了 scripts/_text_similarity.py(3 路客户端去重:标准化/相似度/阈值/重试常量)+ scripts/_passport_yaml.py(2 路迁移工具去重:ruamel.yaml 往返配置)+ 私有 _resolve_by_doi_then_title 辅助函数(2 路解析器主体去重,§3.4 / §3.5 API 表面保持不变)。将限流测量标准化为 time.monotonic(跨 OpenAlex + Crossref,之前是 time.time,NTP 不安全),与 Semantic Scholar 对齐。所有 5 个模块级交叉导入的双路径导入基础设施(兄弟优先,命名空间包回退)保留了 SemanticScholarUnavailable 的类标识,并额外修复了 2 个潜伏的损坏 import scripts.X 路径。1505 个测试通过(新增 23 个,0 回归)。#128 §4(并行化每条目的 OA + CR)推迟到 #138。

v3.9.2 (2026-05-18) — #133 阶段边界热修复

#133 关闭(热修复层)。长期架构修复作为 v3.10 主动导体在 #134 中跟踪。新增:CLAUDE.md 中的路由澄清门(跨阶段材料 → 用 a-d 选项澄清,而非静默分发),22 个单阶段代理获得提示硬围栏(## Phase Boundary (v3.9.2)),16 个多阶段 / 阶段正交 / 跨阶段元代理有意不设围栏(诚实的框架——散文安慰剂制造了虚假执行的幻觉),咨询验证器 scripts/check_pipeline_integrity.py 事后检测 #133 模式。跨模型抽点的行为冒烟测试(100% Opus 4.7, ≥75% Sonnet + GPT-5.5)。

v3.9.1 (2026-05-18) — #129 + #130 客户端加固

v3.9.0 热修复。将 OpenAlex / Crossref 响应读取失败包装为 *Unavailable (#129);保护 check_claim_audit_consistency 免受非字符串 manifest_id 影响 (#130)。无规范变更。

v3.9.0 (2026-05-17) — #102 跨索引三角测量

#102 关闭。v3.7.3 发布了单索引(Semantic Scholar)污染检测;v3.9.0 扩展为三索引三角测量(S2 + OpenAlex + Crossref),仅作为咨询证据contamination_signals 上新增两个可选布尔值(openalex_unmatched, crossref_unmatched);手动录入 not-rule 对称扩展。终结器新增一个 4 级咨询矩阵(k=0/1/2/3 基于存在的 *_unmatched 字段),为 k=1/k_max=1 的仅 S2 场景保留 v3.7.3 遗留的 CONTAMINATED-UNMATCHED。格式化器放行白名单从 3 个后缀扩展为 9 个;拒绝规则 1-10 按 R-L3-2-E 不变。策略层(严格模式、硬阻断层级、venue_type / triangulation_policy)推迟到 v3.10,按规范 §2.3。k=3 标记为 CONTAMINATED-TRIANGULATION-UNMATCHED(描述可观察现象,而非推断原因)。3 条新硬规则:R-L3-2-C(k 基于存在字段计算)、R-L3-2-D(无 API 推断分类)、R-L3-2-E(拒绝列表不变;放行白名单扩展)。

迁移: v3.7.3 语料库——运行 python scripts/migrate_literature_corpus_to_v3_9_0.py PATH 回填两个新字段。v3.7.3 之前的语料库——先运行 migrate_literature_corpus_to_v3_7_3.py,然后运行 v3.9.0 迁移(按规范 §3.7 链式处理;v3.9.0 工具仅作用于已携带 contamination_signals.semantic_scholar_unmatched 的条目)。

v3.8.2 (2026-05-17) — #118 未引用审计工具故障表面

#118 关闭。ARS_CLAIM_AUDIT=1 未引用约束判断路径在 JudgeInvocationError 时曾静默替换为 {"judgment": "NOT_VIOLATED"},抑制了因瞬态法官中断导致的 HIGH-WARN 约束检查。v3.8.2 将这些失败路由到专用的 uncited_audit_failures[] 聚合(MED-WARN 咨询层级),镜像了引用路径的 INV-14 行,但使用专用模式,因为 claim_audit_result.ref_slug 是必需的,而未引用路径没有可绑定的引用。#118 issue 正文中的四个选项 1..4 权衡最终选择了选项 2(新聚合)——选项 4(重新抛出并中止)因对不稳定法官端点的审计覆盖率影响而被拒绝。

  • 新增 uncited_audit_failure.schema.json 聚合(规范 §3.6)。每个未引用句子 × manifest 对一条记录,其中约束法官抛出 JudgeInvocationError。与引用路径 INV-14 相同的故障类枚举(judge_timeout / judge_api_error / judge_parse_error / cache_corruption / retrieval_api_error / retrieval_timeout / retrieval_network_error)。rule_version: D4-c-v1-uaf-v1
  • UAF-INV-1..UAF-INV-6 lint(规范 §6 规则 4d)。finding_id 唯一性、scoped_manifest_id 跨数组完整性、manifest_claim_id 非空时的 (M, C) 对完整性、每个 (句子, manifest) 去重、理由 fault_class 前缀、跨聚合互斥性 vs constraint_violations[]
  • 终结器 §5 MED-WARN 咨询行:注释 [CLAIM-AUDIT-TOOL-FAILURE-UNCITED — <fault-class>],门通过(重试下一轮修复)。格式化器 REFUSE 列表不变——UAF 是咨询性的。
  • 流水线集成scripts/claim_audit_pipeline.py):在第 1211-1224 行的吞没点移除;JudgeInvocationError 现在发出 UAF 行并 continue 到下一个 (句子, manifest) 对。无虚假 NOT_VIOLATED 到达 constraint_violations[]
  • 测试:新增 18 个(15 个模式/lint TSUAFUncitedAuditFailureInvariants + 3 个流水线集成 TP23UncitedJudgeOutageEmitsUAF)。基线从 694 个测试增长到 712 个,0 回归。
  • 代理文档academic-pipeline/agents/claim_ref_alignment_audit_agent.md):输出发射表新增第七行;错误处理表从 3 个表面扩展到 4 个表面,包含未引用路径 UAF 行。

v3.8.0 (2026-05-16) — L3 主张忠实性定位器 + 审计(配对里程碑)

v3.7.3 + v3.8 端到端填补了 L3(主张忠实性)缺口。v3.7.3 发布了定位器基础设施——每个引用携带三层锚点,以便未来审计能获取引用的段落。v3.8 发布了审计阶段,消费这些锚点,判断引用来源是否支持主张,并在格式化器终端硬门上门控拒绝 HIGH-WARN 违规。该版本还捆绑了自 v3.7.0 以来积累的 5 个审计轨迹功能 PR(#104 / #105 / #108 / #111 / #115)。

  • #103 — claim_ref_alignment_audit_agent(v3.8 PR #121)。可选(ARS_CLAIM_AUDIT=1,默认关闭)第 4→5 阶段审计代理。判断每个采样引用与检索摘录的匹配;发出 claim_audit_results[] + claim_intent_manifests[] + claim_drifts[] + uncited_assertions[] + constraint_violations[] 聚合。8 行终结器矩阵将 HIGH-WARN 类(CLAIM-NOT-SUPPORTED / NEGATIVE-CONSTRAINT-VIOLATION / FABRICATED-REFERENCE / ANCHORLESS / CONSTRAINT-VIOLATION-UNCITED)路由到格式化器 REFUSE 规则 6-10。校准运行器附带 20 元组黄金集(T-C1 FNR<0.15 + FPR<0.10,T-C2 每类,T-C3 形状完整性)。8 轮双轨审查(R1 codex + Gemini-3.1-pro-preview,Gemini 配额耗尽后 R2-R8 仅 codex);轨迹 R1 4P1+2P2 → R8 0P1+4P2 发布门。
  • v3.7.3 — 三层引用发射 + 污染信号(PR #98)。synthesis_agent / draft_writer_agent / report_compiler_agent 增加 ## Three-Layer Citation Emission (v3.7.3) H2。每个 <!--ref:slug--> 携带 <!--anchor:<kind>:<value>-->,其中 <kind> ∈ {quote, page, section, paragraph, none}(quote 锚点限制 25 词,URL 编码)。pipeline_orchestrator_agent 终结器变为 5 单元格,包含优先级零的 NO-LOCATOR 检查。formatter_agent[UNVERIFIED CITATION — NO QUOTE OR PAGE LOCATOR] 增加显式硬门拒绝。literature_corpus_entry.schema.json 增加可选 contamination_signals: { preprint_post_llm_inflection, semantic_scholar_unmatched } 对象。bibliography_agent 在摄取时计算两个信号。11 轮审查轨迹(Codex×10 + Gemini 跨模型×1)关闭了 22 个发现。规范:docs/design/2026-05-12-ars-v3.7.3-claim-faithfulness-and-contaminated-source-spec.md。外部动机:Zhao et al. arXiv:2605.07723 (2026-05)。
  • #108 — AI 披露政策锚点渲染器(2026-05-14 审计轨迹发布)。在现有场地跟踪渲染器旁边增加 PRISMA-trAIce / ICMJE / Nature / IEEE 政策锚点披露路径。
  • #111 — slr_lineage 在系统综述 → 学术论文交接时发射(2026-05-15)。模式 9 可选布尔字段 slr_lineage;生产者 pipeline_orchestrator_agent 在每次交接过渡时写入;消费者 disclosure 模式根据 §4.3 G2 不变跟踪门分派 --policy-anchor=prisma-trAIce
  • #104 — README 动机:Zhao et al. 语料库规模证据锚点(2026-05-15)。README + README.zh-TW.md 动机部分将 v3.7.x 系列置于 Zhao et al. 的 146,932 个幻觉引用发现之上。
  • #105 — v3.7.3 contamination_signals 回填迁移工具(2026-05-15)。scripts/migrate_literature_corpus_to_v3_7_3.py 对 v3.7.3 之前的护照回顾计算两个污染信号。
  • #115 — Semantic Scholar 客户端成熟度(2026-05-15)。scripts/semantic_scholar_client.py 增加 1 req/s 节流(检测到 S2_API_KEY 时降至 0.1s),对 URLError 的中断锁存,以及用于长时间运行的跨护照批次的 reset_outage_latch()

v3.7.0 (2026-05-05) — Claude Code 插件打包

插件打包升级:ARS 现在可以通过 /plugin marketplace add Imbad0202/academic-research-skills + /plugin install academic-research-skills 在 Claude Code CLI / VS Code / JetBrains 上一行安装。传统的 git clone + symlink to ~/.claude/skills/ 流程仍然有效——两条路径均为一等支持。

  • 插件清单 + 市场元数据(第一阶段,PR #68)。.claude-plugin/plugin.json 声明套件(通过相对符号链接从 skills/ 目录自动发现 4 个技能)。.claude-plugin/marketplace.json 注册插件,使单个 GitHub 托管端点同时服务于市场列表和插件源码。README + README.zh-TW.md + docs/SETUP.md 包含双轨安装说明。
  • 10 个斜杠命令 位于 commands/ars-*.md(第二阶段 2.1,PR #69),将 MODE_REGISTRY.md 条目映射到 /ars-<mode> 触发器。模型路由固定在每个命令的 frontmatter 中——opus 用于 fullrevision-coach(架构 / 审查解释深度),sonnet 用于其他 8 个。根据项目策略,不包含 Haiku。
  • 3 个插件内置的代理 位于 agents/*_agent.md(第二阶段 2.1,PR #69),作为指向 deep-research/agents/ 中经过 v3.6.7 加固的下游代理的相对符号链接:synthesis_agentresearch_architect_agentreport_compiler_agent。保留下划线文件名以保持 scripts/check_v3_6_7_pattern_protection.py 的硬固定路径和 INV-3 清单约束的 Clause 1 不变式。符号链接(而不是副本)保持了单一事实来源,并防止了 v3.6.7 §6 反转扫描 + INV-1/2/3 检查关闭的 Pattern C3 攻击面。(在 #413 中实现为真正的字节相同副本——相对符号链接在没有 core.symlinks 的 Windows 检出和 zip 下载安装中会失效;单一来源保证移至 scripts/check_agents_mirror_sync.py 的字节相等性 CI 检查。)
  • model: inherit 被添加到这三个源代理的 frontmatter 中。选择 inherit 而不是固定 sonnet,以便在运行 ARS 完整管线的 opus 会话中保持 opus 代理(而不是被限制)。用户的 ~/.claude/hooks/warn-agent-no-model.sh PreToolUse 钩子在调度边界处拦截 Haiku,因此 inherit 通过一个已经无 Haiku 的模型来解析。
  • SessionStart 通知钩子 位于 hooks/hooks.json + scripts/announce-ars-loaded.sh(第二阶段 2.2,PR #70)。当插件加载时,该钩子将 additionalContext 注入到 LLM 的第一轮对话中,列出 10 个斜杠命令、3 个插件代理和一个 token 预算指针。startupclear 源值获得完整通知;resumecompact 获得一行确认以避免消耗上下文。兼容 Bash 3.2——在 macOS 的默认 /bin/bash 上运行,无需 brew install bash 要求。
  • 第二阶段 2.2 范围缩减:由于合同差距(SubagentStop 负载不包含阶段/可交付物信息,因此包装器必须半推断所需参数)和调用者类边界(run_codex_audit.sh 第 4-7 行禁止同一会话内 LLM 调用;PostToolUse 在生产会话内触发),SubagentStop → run_codex_audit.sh 审查钩子被排除在 v3.7.0 之外。真正的审查钩子集成推迟到未来版本,届时 ARS 将获得阶段/可交付物传播合同。参见 docs/design/2026-04-30-ars-v3.7.0-plugin-packaging-roadmap.md 2026-05-05 更新说明(第二阶段 2.2 范围缩减)。
  • docs/PERFORMANCE.md + .zh-TW.md 新增了一个“v3.7.0 Plugin agents and model routing”小节,解释了 inherit 语义和当前的 3 代理范围边界。
  • 跨三个 PR 的 Codex 审查链:8 次内联迭代轮次 + 3 次全新的 PR 级轮次,全部在合并前收敛到 0 P0/P1/P2 发现。第二阶段 2.2 的全新 PR 审查发现了一个 P2(未加引号的 ${CLAUDE_PLUGIN_ROOT} 会破坏包含空格的安装路径),而内联轮次遗漏了——这证实了将实现审查(内联)与合同审查(全新)分开的价值。
  • 未变更的内容:四个技能目录、所有 25 个模式、代理提示、模式文件以及 lint 合同。插件打包仅添加了新的顶层结构(commands/agents/hooks/.claude-plugin/skills/ 符号链接目录、三个插件代理的 model: inherit frontmatter 添加)。现有的 4.3k 克隆安装用户不会看到任何破坏性变更。

v3.6.8 (2026-05-03) — Generator-Evaluator Contract Gate (v3.6.6 spec ship)

命名说明:此版本发布了 v3.6.6 generator-evaluator contract 规范和实现。由于项目顺序,v3.6.6 的工作在 v3.6.7 之后落地;设计文档保留了合同门版本的 v3.6.6 内部命名,而套件版本标记为 v3.6.8 以保持 CHANGELOG 的单调性。

  • Schema 13.1 (shared/sprint_contract.schema.json) 扩展了 Schema 13,新增了两个 mode 枚举值(writer_full + evaluator_full)、两个新的可选顶层字段(pre_commitment_artifacts 仅写入者、disagreement_handling 仅评估者)以及 12 个 allOf 分支,强制执行审查者/写入者/评估者条件门。现有审查者合同在 Schema 13.1 下验证为字节等价(§3.6 零接触承诺)。
  • 两个新发布的合同模板 位于 shared/contracts/writer/full.json(D1–D7, F1/F4/F2/F3/F0)和 shared/contracts/evaluator/full.json(D1–D5, F1/F2/F3/F6/F4/F5/F0)。从规范分支上的设计时人工制品提升为实时发布状态,与 Schema 13.1 升级原子性地完成。
  • 两阶段编排academic-paper full 内部:阶段 4 拆分为阶段 4a(写入者论文盲预承诺)+ 阶段 4b(写入者论文可见草稿 + 自评分);阶段 6 拆分为阶段 6a(评估者论文盲预承诺)+ 阶段 6b(评估者论文可见评分 + 决策)。编号为 <phase4a_output> / <phase6a_output> 的数据分隔符镜像了 v3.6.2 审查者模式。Lint 计数摘要:写入者 3+4 / 评估者 5+5 / 审查者 5+6(审查者保持零接触)。
  • academic-paper 技能 + 代理文件 增加了一个逐字的 ## v3.6.6 Generator-Evaluator Contract Protocol 块(SKILL.md 中 101 行,加上 draft_writer_agent.md 中 47 行和 peer_reviewer_agent.md 中 57 行)。SKILL.md 还新增了一个 ## 已知限制 部分,包含针对 v3.6.7+ 的优雅降级和跨会话恢复的前瞻说明。
  • 验证器扩展scripts/check_sprint_contract.py SC-* 模式门控审计(SC-5 + SC-11 仅审查者;SC-9 扩展到所有三个模式家族)。17 个新测试将验证器单元测试计数从 54 增加到 71(正面 + 5 个模式分支反面 + 2 个 §3.6 审查者回归 + 6 个模式门控测试)。
  • 清单 CI 检查scripts/check_v3_6_6_ab_manifest.pytests/fixtures/v3.6.6-ab/manifest.yaml 上强制执行 §6.2 清单模式 + §6.5 git 跟踪不变式。.github/workflows/spec-consistency.yml 扩展了冲刺合同验证循环,在现有审查者循环之外迭代写入者 + 评估者模板目录,并运行新的清单 CI 检查。
  • A/B 证据固定装置存根 位于 tests/fixtures/v3.6.6-ab/(30 个文件):清单 + README + 6 个论文 A 输入/基准 + 1 个论文 C 输入/基准 + 阶段 3 审查者摘录 + 6 个 codex-judge 基准占位符。真实固定装置数据将在后续提交中填充,在实现工作完全完成之前。

v3.6.7 (2026-04-30) — 下游 Agent 模式保护(第 1+2 步)

  • 三个下游 Agent 针对 17 个已记录的幻觉/漂移模式中的 13 个进行了强化synthesis_agent(A1–A5 叙述侧)、research_architect_agent 的调查设计模式(B1–B5 工具侧)以及 report_compiler_agent 的仅摘要模式(C1–C3 出版侧)。每个 Agent 提示现在都带有一个 PATTERN PROTECTION (v3.6.7) 块。
  • shared/references/ 中的四个参考文件irb_terminology_glossary.mdpsychometric_terminology_glossary.mdprotected_hedging_phrases.mdword_count_conventions.md。这些参考文件携带操作契约,Agent 提示通过路径引用这些契约。
  • 跨模型审计提示模板位于 shared/templates/codex_audit_multifile_template.md,包含七个审计维度,以及对 report_compiler_agent 捆绑包强制执行的三个部分 Section 4(f) 检查。任何子检查失败均视为 P1 发现。
  • 静态 lint + 29 项测试变异套件scripts/check_v3_6_7_pattern_protection.py 强制执行保护子句存在性和义务短语形式;scripts/test_check_v3_6_7_pattern_protection.py 保留 codex 审查证据,以便未来的检查器回归在 CI 中显现。两者均已接入 .github/workflows/spec-consistency.yml
  • Codex 审查历史:七轮 gpt-5.5 + xhigh 跨模型审查达到 SHIP-OK,且零 P1+P2 发现。第 6 步(编排器运行时 hooks)和第 8 步(合成评估用例)将在后续 PR 中发布。

v3.6.5 (2026-04-27) — Material Passport literature_corpus[] 消费者集成

  • 两个 Phase 1 文献消费者已接入deep-research/agents/bibliography_agent.mdacademic-paper/agents/literature_strategist_agent.md。两者在 passport 携带非空 literature_corpus[] 时遵循相同的五步语料库优先、搜索填补空白流程,以及相同的四条铁律(相同标准 / 无静默跳过 / 无语料库变异 / 解析失败时优雅降级)。
  • 搜索策略报告中的 PRE-SCREENED 可重现性块:列举了包含/排除/跳过的语料库条目,附带 F3 零命中注释和 F4a–F4f 来源报告,这些报告围绕 obtained_via / obtained_at 的部分声明进行组合。final_included = pre_screened_included[] ∪ external_included[] 保持中立——在参考文献条目或文献矩阵行上不添加来源标签。
  • 消费者协议参考位于 academic-pipeline/references/literature_corpus_consumers.md,包含规范的 PRE-SCREENED 模板、BAD/GOOD 示例、四条铁律以及每个消费者的阅读说明。
  • CI lint scripts/check_corpus_consumer_protocol.py,通过清单驱动的消费者列表(scripts/corpus_consumer_manifest.json)强制执行九项协议不变式。
  • Schema 9 注意事项已移除shared/handoff_schemas.md 移除了 v3.6.4 中“消费者端集成推迟到 v3.6.5+”的注意事项;替换为指向消费者协议的反向指针。
  • 基于存在性,无 schema 变更,无新环境标志。解析失败降级为仅外部数据库流程,并显示 [CORPUS PARSE FAILURE] 表面。citation_compliance_agent 语料库集成推迟(目标版本待定,在 v3.8 之后)。
  • 无破坏性变更。现有用户适配器无需修改即可工作。

v3.6.4 (2026-04-25) — Material Passport literature_corpus[] 输入端口

  • literature_corpus[] 字段作为用户自有文献的可选输入端口添加到 Schema 9。每个条目符合 shared/contracts/passport/literature_corpus_entry.schema.json(CSL-JSON 作者、年、标题、source_pointer + 私有可选字段 abstract / user_notes)。
  • 语言无关适配器契约位于 academic-pipeline/references/adapters/overview.md:任何读取用户语料库源的程序(任何语言)都可以生成符合规范的 passport.yaml + rejection_log.yaml。条目级错误软失败,适配器级错误硬失败,确定性排序。
  • scripts/adapters/ 下的三个参考 Python 适配器folder_scan.py(PDF 文件系统)、zotero.py(Better BibTeX JSON 导出)、obsidian.py(库房 frontmatter)。仅作为起点;用户应为其非参考源编写自己的适配器。
  • 拒绝日志契约位于 shared/contracts/passport/rejection_log.schema.json,带有封闭的分类原因值枚举;始终生成(无拒绝时为空)。
  • CI 门控scripts/check_literature_corpus_schema.py 验证 schema + 适配器示例;scripts/sync_adapter_docs.py --check 防止 schema→文档漂移;新的 pytest.yml 工作流在路径过滤触发时运行 scripts/adapters/tests/
  • v3.6.4 仅限输入端口:v3.6.4 发布了 schema 和适配器契约,但未集成消费者。bibliography_agentliterature_strategist_agent 在 v3.6.5 中接入。
  • 无破坏性变更。

v3.6.3 (2026-04-23) — 可选 Passport 重置边界

  • 可选 passport 重置边界ARS_PASSPORT_RESET=1)。将每个 FULL 检查点提升为上下文重置边界。新的 resume_from_passport=<hash> 模式允许用户在全新的 Claude Code 会话中仅从 Material Passport 账本恢复。systematic-review 模式在标志开启时使重置在每个 FULL 检查点成为强制;其他模式将重置视为标志门控的默认行为。标志关闭时保持 v3.6.3 之前的行为逐字节不变。
  • Schema 9 获得一个仅追加的 reset_boundary[] 账本,包含两种条目类型(kind: boundary + kind: resume)。哈希使用 JSON Canonical Form + SHA-256,并带有自引用安全的规范占位符。可选的 pending_decision 处理 MANDATORY 分支选择。
  • 新的 CI lint scripts/check_passport_reset_contract.py:每个提及标志的地方必须同时指向权威协议文档的指针。
  • 协议文档:academic-pipeline/references/passport_as_reset_boundary.md
  • docs/PERFORMANCE.md 更新了长时间运行会话指南。
  • 无破坏性变更。标志默认关闭。

v3.6.2 (2026-04-23) — 审稿人 Sprint 契约硬门控

v3.6.2 引入了 Schema 13 sprint 契约和一个硬门控编排,强制审稿人在阅读论文之前预先提交其评分计划。仅限审稿人的首个测试用例;作者/评估者推迟到 v3.6.4。详见 CHANGELOG。

  • Schema 13 sprint 契约包含 panel_sizeacceptance_dimensionsfailure_conditions(带有 severity 优先级 + 面板相对 cross_reviewer_quantifier)、measurement_procedure、可选的 override_ladder、有界的 agent_amendments。验证器:scripts/check_sprint_contract.py
  • 两次调用硬门控。 审稿人首先运行论文内容盲 Phase 1,然后运行论文可见 Phase 2;Phase 1 输出被包裹在 <phase1_output>...</phase1_output> 数据分隔符中,以缩小自注入攻击面。
  • 合成器三步机械协议。 构建跨审稿人矩阵 → 使用面板相对量词和已识别表达词汇评估每个 failure_condition → 按 severity 解析优先级。editorial_synthesizer_agent 中明确列出了禁止操作列表。
  • 两个审稿人模板发布shared/contracts/reviewer/full.json 面板 5;shared/contracts/reviewer/methodology_focus.json 面板 2)。reviewer_re_reviewreviewer_calibrationreviewer_guided 在 schema 枚举中保留,但 v3.6.2 不附带契约模板;它们保持 v3.6.2 之前的行为。reviewer_quick 完全从枚举中排除。
  • academic-paper-reviewer SKILL 版本:1.8.1 → 1.9.0academic-pipeline SKILL 版本:3.5.1 → 3.6.2(套件版本不变)。套件版本号提升至 3.6.2
  • 参见规范 docs/design/2026-04-23-ars-v3.6.2-sprint-contract-design.md 和协议 academic-paper-reviewer/references/sprint_contract_protocol.md

v3.5.1 (2026-04-22) — 可选的苏格拉底阅读检查探测

v3.5.1 为苏格拉底导师(ARS_SOCRATIC_READING_PROBE=1)增加了一个可选的诚实性探测。默认关闭。详见 CHANGELOG。

  • 可选的阅读检查探测:当设置 ARS_SOCRATIC_READING_PROBE=1 时,在用户引用特定论文的目标导向会话中,苏格拉底导师会触发一次性的诚实性探测。拒绝会被记录而不受惩罚。结果流向研究计划摘要和第6阶段 AI 自我反思报告。无需新增智能体,无模式变更。
  • deep-research SKILL 版本:2.9.0 → 2.9.1academic-pipeline SKILL 版本:3.5.0 → 3.5.1。套件版本升至 3.5.1

v3.5.0 (2026-04-21) — 协作深度观察器

  • 新增智能体academic-pipeline 中的 collaboration_depth_agent(智能体团队从3个增加到4个)。在每个 FULL/SLIM 检查点以及流水线完成时调用;根据4维度评分标准对用户-AI 协作进行评分。仅提供建议——绝不阻塞进度。 强制检查点(第2.5/4.5阶段完整性门控)不调用观察器。
  • 新评分标准shared/collaboration_depth_rubric.md v1.0。维度:委派强度、认知警觉性、认知重新分配、区域分类(区域1/区域2/区域3)。基于 Wang, S., & Zhang, H. (2026). “Pedagogical partnerships with generative AI in higher education: how dual cognitive pathways paradoxically enable transformative learning.” International Journal of Educational Technology in Higher Education, 23:11. DOI 10.1186/s41239-026-00585-x
  • 跨模型差异被标记,而非平均:当设置 ARS_CROSS_MODEL 时,观察器在两个模型上运行;维度差异 > 2 分时报告,而非静默平滑。通过 ARS_CROSS_MODEL_SAMPLE_INTERVAL 逃生舱口进行成本权衡。
  • 短阶段防护:用户轮次少于5次的阶段会注入静态的 insufficient_evidence 块,而不是调度完整模型观察器。
  • 反谄媚纪律:得分 ≥ 7 需要具体的对话轮次引用;区域3触发重新审计;无动机框架。
  • academic-pipeline SKILL 版本:3.3.0 → 3.4.0。套件版本升至 3.5.0。新增 lint 脚本 scripts/check_collaboration_depth_rubric.py + 10个测试。

v3.4.0 (2026-04-20) — 合规智能体 + 模式12

  • 合规智能体(共享):单个模式感知的智能体,运行 PRISMA-trAIce 17项(仅系统评价模式)+ RAISE 4项原则 + 8角色矩阵。挂接到现有第2.5/4.5阶段完整性门控;基于层级阻塞(强制→阻塞,HR→警告,R/O→信息)。非系统评价条目仅运行原则,仅警告。
  • 模式12 compliance_report 通过 compliance_history[] 追加到 Material Passport中(仅追加)。
  • 3轮用户覆盖阶梯自动将 disclosure_addendum 注入稿件。无法规避检测。
  • 具有透明报告的校准,无硬性 FNR/FPR 门控——与 task_type: open-ended 自洽。
  • 上游新鲜度 CI 在 PRISMA-trAIce 漂移时发出警告(非阻塞)。
  • 长会话文档:Material Passport 作为跨会话恢复机制。

v3.3.6 (2026-04-15) — README 精简 + ARCHITECTURE 文档

  • 新增 docs/ARCHITECTURE.md 作为流水线结构的单一真相来源(流程、矩阵、数据访问、依赖图、质量门控、模式)。通过 PR #18 合并到主分支。
  • 新增 docs/SETUP.md(先决条件、API 密钥、Pandoc/tectonic、跨模型验证、安装方法)和 docs/PERFORMANCE.md(令牌预算、推荐的 Claude Code 设置)。README 链接到这两个文档,而非内联它们。
  • 精简 README:移除了 ASCII 流水线图和16点关键特性列表(已被 ARCHITECTURE.md 取代);技能详情部分现在锚定版本号,并引导读者阅读 ARCHITECTURE.md §3 以获取每个智能体的名单。
  • 注意:任何技能均无功能变化。纯文档重组。套件版本升至 3.3.6

v3.3.5 (2026-04-15)

  • 新增 benchmark_report.schema.json + Material Passport 上的可选 repro_lock 块。两者均附带模式文档、lint 和示例。首个正式 Python 开发依赖清单(requirements-dev.txt)。

v3.3.4 (2026-04-15) — README 更新日志同步补丁

  • 同步了 README.mdREADME.zh-TW.md 中的嵌入式更新日志部分,使其包含缺失的 v3.3.3v3.3.2 版本摘要。
  • 扩展了 scripts/check_spec_consistency.py,使未来的 README 更新日志漂移会导致 CI 失败。

v3.3.3 (2026-04-15) — 发布准备 + Lint 强化

  • 强化了 SKILL 前置元数据 lint:缺失结束 --- 分隔符现在会干净地失败,而不是被解析为有效的 YAML。
  • 解析为有效 YAML 但不是映射的前置元数据现在会报告可读错误,而不是崩溃。
  • 修复了两个 README 中发布后审计报告失效的展示链接。
  • 向规范一致性检查添加了 README 相对链接验证,使死链接导致 CI 失败。
  • 统一了文档中的 DOCX 输出契约:直接 .docx 生成依赖于 Pandoc,以 Markdown + 转换说明作为后备。
  • 准备了 v3.3.3 发布:套件版本升级,academic-paper -> v3.0.2,academic-pipeline -> v3.2.2。

v3.3.2 (2026-04-15) — 数据访问级别 + 任务类型元数据

  • 向所有顶级 SKILL.md 文件添加了 metadata.data_access_level,并强制使用词汇:rawredactedverified_only
  • 向所有顶级 SKILL.md 文件添加了 metadata.task_type,并强制使用词汇:open-endedoutcome-gradable
  • 为这两个元数据字段添加了 lint 脚本和单元测试,并连接到 GitHub Actions 规范一致性工作流。
  • 添加了 shared/ground_truth_isolation_pattern.md 并从 shared/handoff_schemas.md 链接了新词汇。

v3.3.1 (2026-04-14) — 规范一致性补丁

  • 同步了 README、.claude/CLAUDE.mdMODE_REGISTRY.mdSKILL.md 文件,以匹配当前的模式计数和已发布的技能版本。
  • 修正了跨模型措辞:完整性样本检查和独立 DA 批评已实现;第六审稿人同行评审仍为计划中。
  • 阐明了自适应检查点语义,使 SLIM 检查点仍等待用户明确确认。
  • 重申第2.5阶段和第4.5阶段完整性门控不可跳过。
  • 添加了轻量级规范一致性检查和 GitHub Actions 工作流,以捕获未来漂移。

v3.3 (2026-04-09) — PaperOrchestra 启发增强

整合了 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)的技术。

  • Semantic Scholar API 验证 — 通过 S2 API 进行第0级程序化参考文献存在性检查。Levenshtein >= 0.70 标题匹配,DOI 不匹配检测,通过 S2 ID 进行参考文献去重。如果 API 不可用,则优雅降级。
  • 反泄漏协议 — 知识隔离指令优先使用会话材料而非 LLM 参数记忆。对缺失内容标记 [MATERIAL GAP],而不是从记忆中填充。降低模式5/6失败风险。
  • VLM 图表验证(可选) — 使用视觉能力 LLM 对渲染图表进行闭环验证。10点检查清单,最多2次细化迭代。
  • 分数轨迹协议 — 跨修订轮次的每个维度评分标准分数增量跟踪(7个维度)。检测回归(delta < -3)并触发强制检查点。
  • 第2阶段并行化 — 可视化与论点构建可在提纲完成后并行运行。
  • 新版本:deep-research v2.8,academic-paper v3.0,academic-pipeline v3.2

v3.2 (2026-04-09) — Lu 2026 Nature Integration

整合了 Lu 等人 (2026, Nature 651:914-919) 的见解——这是首个通过盲审的端到端自主 AI 研究系统。

  • 7 模式 AI 研究失败模式检查清单 — 在阶段 2.5/4.5 阻止流程,针对疑似实施错误、幻觉结果、快捷方式依赖、将错误视为洞察、方法捏造、框架锁定。扩展了现有的 5 类引用幻觉分类法。
  • 审稿人校准模式 (academic-paper-reviewer v1.8) — 可选,根据用户提供的黄金标准集测量 FNR/FPR/平衡准确率。5 倍集成,默认跨模型启用,会话级置信度披露。
  • 披露模式 (academic-paper v2.9) — 默认路径返回 REQUIREDACTION_ONLYNOT_REQUIREDUNKNOWN 适用性,并在需要时显式给出类型化停止状态;策略锚定调用使用其单独的锚定特定渲染器。v1 涵盖 ICLR、NeurIPS、Nature、Science、ACL、EMNLP(此后已扩展:v2 数据库 (#596) 新增 9 个医学出版政策目标——ICMJEn、NEJM、The Lancet、JAMA、BMJ、PLOS、Frontiers,以及数据库首批两个中文政策目标:出版商范围的 中华护理杂志社 条目和期刊 国际眼科杂志。)
  • 早停准则 (academic-pipeline v3.1) — 流程开始时进行收敛检查 + 预算透明度。
  • 保真度-原创性模式频谱 — 根据 Lu 2026 图 1c 将所有模式按 3 项技能分类。
  • 新版本:academic-paper v2.9、academic-paper-reviewer v1.8、academic-pipeline v3.1

v3.1.1 (2026-04-09) — IS 高级学者 11 种期刊篮子

外部贡献:@mchesbro1 最初提出并起草了 IS 8 种期刊篮子 (Issue #5);@cloudenochcsis 将其扩展为完整的高级学者 11 种期刊篮子 (Issue #7PR #8)。更新了 academic-paper-reviewer/references/top_journals_by_field.md 第 7 节,增加了 Decision Support SystemsInformation & ManagementInformation and Organization。来源:AIS 高级学者顶级期刊列表

v3.1 (2026-04-06) — 反上下文退化 + 认知框架 + 精简规模

灵感来自 aspi6246/Claude-Code-Skills-for-Academics 的模式。

第一波:反上下文退化锚点

  • 所有 4 项技能共 29 个显式反模式(每项技能 7-8 个,表格形式,包含“失败原因”+“正确行为”)
  • 22 个铁律标记,用于关键规则,即使在长对话中也不得违反
  • 对 academic-paper-reviewer 的只读约束(审稿人不得修改稿件)

第二波:可追溯性 + 认知框架 + 强化

  • 修订与回复可追溯性矩阵(模式 11):在重新审阅输出中增加“作者声明”和“已验证?”列,支持独立验证修订声明
  • 3 个认知框架参考文件,教导智能体“如何思考”而不仅仅是“做什么”:
    • argumentation_reasoning_framework.md — 图尔敏模型、Bradford Hill 因果推理、最佳解释推理、知识状态分类
    • review_quality_thinking.md — 三个透镜(内部效度、外部效度、贡献)、常见审稿人陷阱、校准问题
    • writing_judgment_framework.md — 清晰度测试、读者旅程、学科特定语调、修订决策矩阵
  • 对话中强化协议:每个流程转换时进行阶段特定的铁律 + 反模式提醒
  • 每个完整检查点进行自我检查问题(引用完整性、谄媚性让步、质量轨迹、范围纪律、完整性)

第三波:精简技能规模

  • SKILL.md 总大小从 142KB 减少到 85KB(−40%),方法是将详细协议提取到 references/ 文件中
  • 创建了约 15 个新的参考文件(重新审阅协议、引导模式、系统综述、过程摘要、外部审阅等)
  • 所有铁律标记保留在 SKILL.md 中;详细内容按需加载
  • 新版本:deep-research v2.7、academic-paper v2.8、academic-paper-reviewer v1.7、academic-pipeline v3.0

v3.0 (2026-04-03) — 反谄媚 + 意图检测 + 对话健康

  • 魔鬼代言人让步阈值 (deep-research + academic-paper-reviewer):DA 必须在回应前对反驳进行 1-5 分评分。仅在 ≥4 分时让步。不得连续让步。跟踪让步率。每个检查点后检测框架锁定。
  • 攻击强度保持 (academic-paper-reviewer):DA 在面对推诿时不会软化。建立反驳评估协议,包含显式回避检测。反谄媚规则防止将持续推诿视为有效证据。
  • 意图检测层 (deep-research socratic):将用户意图分类为探索型或目标导向型。探索型模式禁用自动收敛,增加最大轮数,禁止过早结束。每 3 轮重新评估一次。
  • 对话健康指标 (deep-research socratic):每 5 轮进行一次静默自我检查,检测持续同意、冲突回避、过早收敛。当检测到同意模式时自动注入挑战。
  • 跨模型验证协议 (共享,可选):使用 GPT-5.4 Pro 或 Gemini 3.1 Pro 进行完整性验证的样本交叉检查以及独立的 DA 批评。第六审稿人同行评审仍处于计划中,尚未实现。通过设置 ARS_CROSS_MODEL 环境变量激活——不设置则一切照旧。完整设置指南、API 模式和成本估算见 shared/cross_model_verification.md
  • AI 自我反思报告 (academic-pipeline 阶段 6):流程结束后对 AI 行为模式的自我评估——DA 让步率、检查点跳过率、健康警报、谄媚风险评级(LOW/MEDIUM/HIGH)、框架锁定事件、收敛模式分析。包含讽刺性说明:“此自我反思本身由同一可能已表现出谄媚的 AI 生成。”
  • 起源:通过一轮 4 轮对话实验发现,其中 DA 让步过快,苏格拉底导师试图过早收敛,整个辩论始终锁定在人类设定的框架内。
  • 版本:deep-research v2.5、academic-paper-reviewer v1.5、academic-pipeline v2.8

v2.9.1 (2026-04-03) — 技能元数据

  • 在所有 4 个 SKILL.md 的前言中增加了 status: activerelated_skills 交叉引用。
  • 支持技能发现工具以及 deep-researchacademic-paperacademic-paper-revieweracademic-pipeline 之间的跨技能导航。

v2.9 (2026-03-27) — 风格校准 + 写作质量检查

  • 风格校准 (academic-paper 输入阶段 10,可选):提供 3 篇以上已发表论文,流程将学习你的写作风格——句子节奏、词汇偏好、引用整合方式。在写作过程中作为软指导应用;学科惯例始终优先。优先级系统:学科规范(硬)> 期刊惯例(强)> 个人风格(软)。详见 shared/style_calibration_protocol.md
  • 写作质量检查 (academic-paper/references/writing_quality_check.md):在草稿自我审阅期间应用的写作质量检查清单。5 个类别:AI 高频术语警告(25 个术语)、标点模式控制(破折号 ≤3)、开场白冗余检测、结构模式警告(三元组、均匀段落、同义词循环)、以及波动性检查(句子长度变化)。这些是好的写作规则——而非逃避检测的手段
  • 风格档案 通过 academic-pipeline 的材料护照传递(shared/handoff_schemas.md 中的模式 10)
  • deep-research 报告编译器也可选地使用这两个功能
  • 版本:academic-paper v2.5、deep-research v2.4、academic-pipeline v2.7

v2.8 (2026-03-22) — SCR Loop Phase 1: State-Challenge-Reflect

  • Socratic Mentor Agent (deep-research + academic-paper): SCR (State-Challenge-Reflect) 协议集成
    • 承诺门 (Commitment Gates):在每层/章节过渡时呈现证据前,收集用户预测
    • 确定性触发矛盾 (Certainty-Triggered Contradiction):检测高置信度语言(“显然”、“清楚地”),并引入反驳观点
    • 自适应强度 (Adaptive Intensity):追踪承诺准确性,动态调整质疑频率
    • 自校准信号 (S5):新的收敛信号,追踪整个对话中用户自校准的增长
    • SCR 开关 (SCR Switch):用户可以说“跳过预测”以禁用,或说“重新打开预测”以在对话中重新启用;苏格拉底式提问正常进行
  • deep-research/references/socratic_questioning_framework.md: SCR 覆盖协议将 SCR 阶段映射到苏格拉底功能
  • 新增 CHANGELOG.md

v2.7 (2026-03-09) — 完整性验证 v2.0:反幻觉重构

  • integrity_verification_agent v2.0:反幻觉指令(无 AI 记忆验证),消除灰色地带分类(仅保留 VERIFIED/NOT_FOUND/MISMATCH),每个引用强制 WebSearch 审计追踪,第 4.5 阶段全新独立验证,灰色地带预防规则
  • 已知幻觉模式:来自 GPTZero × NeurIPS 2025 研究的 5 类型分类法(TF/PAC/IH/PH/SH),5 种复合欺骗模式,真实案例研究,文献统计数据
  • 发表后审计:对所有 68 个引用进行完整 WebSearch 验证,发现 21 个问题(31% 错误率),这些问题通过了 3 轮完整性检查——证明了外部验证的必要性
  • 论文修正:移除 4 个虚构引用,修正 6 处作者错误,更正 7 处元数据错误,修复 2 个格式问题

v2.6.2 (2026-03-09) — 基于意图的模式激活

  • deep-research:苏格拉底模式现在使用基于意图的激活,而非关键词匹配。适用于任何语言——检测含义(例如“用户希望引导思考”),而非匹配特定字符串。
  • academic-paper:计划模式现在使用基于意图的激活。检测意图信号,如“用户不确定如何开始”或“用户希望逐步指导”,支持任何语言。
  • 两种模式现在都有默认规则:当意图模糊时,优先选择 socratic/plan 而非 full——先引导更安全。
  • 两层架构:第一层(技能激活)使用双语关键词提高匹配置信度;第二层(模式路由)使用语言无关的意图信号。

v2.6.1 (2026-03-09) — 双语触发关键词

  • deep-research:新增繁体中文触发关键词,用于通用激活和苏格拉底模式。
  • academic-paper:新增繁体中文触发关键词和计划模式触发部分。
  • 两个模式选择指南现在均包含双语示例和中文特定的误选场景。

v2.6 / v2.4 / v1.4 (2026-03-08) — 15+ 项改进

  • deep-research v2.3:新增系统综述/PRISMA 模式(第 7 种);3 个新代理(risk_of_bias, meta_analysis, monitoring);PRISMA 协议/报告模板;苏格拉底收敛标准(4 个信号 + 自动结束);快速模式选择指南
  • academic-paper v2.4:2 个新代理(visualization, revision_coach);修订追踪模板,包含 4 种状态类型;引文格式转换(APA↔Chicago↔MLA↔IEEE↔Vancouver);统计可视化标准;苏格拉底收敛标准;修订恢复示例;LaTeX 输出加固——强制使用 apa7 文档类,文本对齐修复(ragged2e + etoolbox),表格列宽公式,双语摘要居中,标准化字体栈(Times New Roman + Source Han Serif TC VF + Courier New),仅通过 tectonic 生成 PDF
  • academic-paper-reviewer v1.4:质量评分标准,0-100 分制及行为指标;决策映射(≥80 接受,65-79 小修,50-64 大修,<50 拒稿);快速模式选择指南
  • academic-pipeline v2.6:自适应检查点系统(FULL/SLIM/MANDATORY);完整性检查中的 E 阶段声明验证;材料护照用于中途溯源;跨技能模式顾问(14 种场景);团队协作协议;增强型交接模式(9 种模式);完整性故障恢复示例

v2.4 / v1.3 (2026-03-08)

  • academic-pipeline v2.4:新增第 6 阶段“流程总结”——自动生成结构化论文创建过程记录(MD → LaTeX → PDF,双语);强制最终章节:协作质量评估,包含 6 个维度,每项评分 1–100(方向设定、智力贡献、质量把关、迭代纪律、授权效率、元学习),诚实反馈及改进建议;流水线从 9 个阶段扩展至 10 个阶段

v2.3 / v1.3 (2026-03-08)

  • academic-pipeline v2.3:第 5 阶段“最终化”现在提示选择格式化样式(APA 7.0 / Chicago / IEEE);PDF 必须通过 tectonic 从 LaTeX 编译(禁止 HTML 转 PDF);APA 7.0 使用 apa7 文档类(man 模式),配合 XeCJK 实现双语 CJK 支持;字体栈:Times New Roman + Source Han Serif TC VF + Courier New

v2.2 / v1.3 (2025-03-05)

  • 跨代理质量对齐:所有代理统一定义(同行评审、时效性规则、CRITICAL 严重性、来源层级)
  • deep-research v2.2:综合反模式,苏格拉底自动结束条件,DOI+WebSearch 验证,增强的伦理完整性检查,模式转换矩阵
  • academic-paper v2.2:4 级论证评分,抄袭筛查,2 个新故障路径(F11 桌面拒稿恢复,F12 会议转期刊),计划→完整模式转换
  • academic-paper-reviewer v1.3:DA 与 R3 角色边界,CRITICAL 发现标准,共识分类(4/3/SPLIT/DA-CRITICAL),置信度评分加权,亚洲及区域期刊参考
  • academic-pipeline v2.2:检查点确认语义,模式切换矩阵,故障回退矩阵,状态所有权协议,材料版本控制

v2.0.1 (2026-03)

  • 简化 4 个 SKILL.md(-371 行,-16.5%):移除跨技能重复,内联模板→文件引用,冗余路由表,重复的模式选择部分
  • 修复 academic-paper 与 academic-pipeline 之间修订循环上限的矛盾

v2.0 (2026-02)

  • academic-pipeline v2.0:5→9 个阶段,强制完整性验证,两阶段评审,苏格拉底修订辅导,可重现性保证
  • academic-paper-reviewer v1.1:+魔鬼代言人审稿人(第 7 个代理),+重审模式(验证),+审后苏格拉底辅导
  • 新代理:integrity_verification_agent——100% 引用/数据验证,附带审计追踪
  • 新代理:devils_advocate_reviewer_agent——8 维度论文挑战者
  • 输出顺序:MD → 可用时通过 Pandoc 转换 DOCX(否则给出说明)→ 询问 LaTeX → 确认 → PDF

v1.0 (2026-02)

  • 初始版本
  • deep-research v2.0(10 个代理,6 种模式,包括苏格拉底模式)
  • academic-paper v2.0(10 个代理,8 种模式,包括计划模式)
  • academic-paper-reviewer v1.0(6 个代理,4 种模式,包括引导模式)
  • academic-pipeline v1.0(编排器)

在 GitHub 查看完整项目