学术科研
面向学术研究全流程的技能套件,覆盖检索、写作、引用核查、同行评审到定稿
面向学术研究的 Claude Code 技能综合套件,覆盖从研究到发表的完整流程。
30 秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
然后尝试 /ars-plan,通过苏格拉底式对话逐步梳理你的论文结构;或跳转到快速安装了解先决条件和传统符号链接流程。
AI 是你的副驾驶,不是主驾驶。 此工具不会替你写论文。它处理繁重工作——查找参考文献、格式化引文、验证数据、检查逻辑一致性——这样你就可以专注于真正需要你大脑的部分:定义问题、选择方法、解释数据的含义,以及写出“我认为……”之后的句子。
与“人性化”工具不同,此工具不会帮你隐藏使用 AI 的事实。它帮你写得更好。风格校准从你过去的工作中学习你的声音。写作质量检查捕捉那些使散文显得机器生成的模式。目标是质量,不是作弊。
为什么采用人在回路而非全自动?
Lu 等人(2026,Nature 651:914-919)构建了 The AI Scientist —— 首个在顶级 ML 会议(ICLR 2025 workshop,得分 6.33/10 vs workshop 平均 4.87)上通过盲审发表论文的全自主 AI 研究系统。其局限性部分列举了任何全自主 AI 研究流程固有的失败模式:实现错误、幻觉结果、捷径依赖、将 bug 当作洞见、方法论捏造、框架锁定、引用幻觉。
ARS 建立在这样的前提下:由 AI 增强的人类研究者比任何单独一方都能更好地避免这些失败模式。Stage 2.5 和 Stage 4.5 完整性门控运行 7 模式拦截清单(参见 academic-pipeline/references/ai_research_failure_modes.md);审阅者提供可选的校准模式,根据用户提供的黄金集测量自身的 FNR/FPR。
Zhao 等人(2026-05)审计了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献。他们保守估计 2025 年单年就有 146,932 次幻觉引用,并观察到 2024 年中期的拐点;对于 bioRxiv 到 PMC 的配对,他们报告论文从预印本到正式发表的一致性为 85.3%。论文将“用于支持引用文献并未实际做出的主张的真实引用”描述为一项开放性挑战。ARS v3.7.1 为来源出处增加了信任链前文;v3.7.3 增加了定位基础设施(三层引用锚点)用于未来的声明级别审计,并在引用时发出咨询性风险信号(ARS 内部将声明忠实性差距标记为“L3”;这是 ARS 术语,非该论文所用)。v3.7.x 的动机来自 Zhao 等人的语料规模发现;对 ARS 本身的语料规模评估仍是未来工作。
v3.8 弥补了 L3 差距的后半部分。v3.7.3 使每条引用都带有一个定位锚点;v3.8 增加了一个可选的审计通道(ARS_CLAIM_AUDIT=1),它会根据每个锚点获取被引来源,并判断该主张是否确实得到支持。五个新的 HIGH-WARN 类别(主张未支持、负面约束违反、虚构参考文献、无锚点、未引用的约束违反)通过格式化终端硬门控拒绝输出。校准以 20 元组黄金集形式发布,接受阈值为 FNR<0.15 + FPR<0.10;按 v3.8 规范 §5,逐步启用计划推迟至校准后证据。
v3.3 受 PaperOrchestra(Song, Song, Pfister & Yoon, 2026,Google)启发:Semantic Scholar API 验证、反泄露协议、VLM 图形验证以及得分轨迹跟踪。
架构与流程
👉 docs/ARCHITECTURE.md —— 完整流程视图:流程图、逐阶段矩阵、数据访问流程、技能依赖图、质量门控和模式列表。
架构文档取代了之前放在这里的庞杂流程描述。关于哪个阶段运行什么的所有内容现在都集中在一个地方。
快速安装
先决条件
- Claude Code(最新版本;插件打包需要较新版本)
- 已导出
ANTHROPIC_API_KEY,或在首次运行claude时设置 - 可选: Pandoc 用于 DOCX,tectonic + Source Han Serif TC 用于 APA 7.0 PDF(Markdown 输出无需两者)
- 可选(真正的 Python): 核心技能(research / write / review)无需 Python——它们由提示驱动。真正的 Python 解释器仅用于:
PreToolUse写入范围防护(可选的子代理加固——如果找不到真正的 Python,它会干净地无操作,防护器仅处于非活动状态;核心技能不受影响),以及少数可选功能,这些功能会调用 Python(修订补丁模式、提交包验证器、以及/ars-cache-invalidate//ars-mark-read//ars-unmark-read命令)。在 Windows 上,请注意python3通常是一个功能不全的 Microsoft Store 占位符,而非真正的 Python;请从 python.org 安装 Python(或通过winget),以便启动器能够找到真正的解释器。防护启动器是一个 POSIX shell 脚本,hooks.json通过bash调用它,因此在 Windows 上需要 Git Bash(随 Git for Windows 捆绑提供)。如果存在 Git Bash,缺少真正的 Python 会干净地降级(防护器无操作,静默)。如果没有 Git Bash,Claude Code 将回退到 PowerShell,后者完全无法运行.sh启动器:防护器处于非活动状态,PreToolUse钩子每次调用都会记录错误而非静默无操作(这是可接受的降级——防护器是可选的,永远不会阻塞你的写入,但在安装 Git Bash 之前,钩子噪音是权衡的代价)。
插件安装(v3.7.0+,推荐):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
验证是否生效: 运行 /ars-plan 并描述你正在写的一篇论文——ARS 将启动苏格拉底式对话来规划章节结构。若要一次性测试,可以尝试 /ars-lit-review "你的主题"。
👉 docs/SETUP.md —— 完整指南:安装 Claude Code、设置 API 密钥、可选的 Pandoc/tectonic 用于 DOCX/PDF、跨模型验证(ARS_CROSS_MODEL),以及六种安装方法(插件、项目技能、全局技能、claude.ai 项目、仓库克隆、Claude Science 导入)。
使用 Claude Science? 四项技能可直接导入:前往 Skills → Import from GitHub,粘贴 https://github.com/Imbad0202/academic-research-skills,点击 Preview,然后 Import 4 skills(需要本仓库 v3.14.0+ 版本——导入器会读取市场清单中的显式技能路径)。导入的是时间点快照:ARS 更新后需重新导入。导入的技能包含 ARS 方法论(研究/写作/审阅协议);Claude Code 特有的机制——斜杠命令、钩子、子代理编排——不会迁移。详情见 docs/SETUP.md 方法 5。
使用 Codex CLI? 请安装兄弟发行版:Imbad0202/academic-research-skills-codex —— 工作流内容相同,采用 Codex 原生打包方式,作为一个单一的 $academic-research-suite 技能,并带有 ars-* 别名。
第三方平台与集成——封装或托管 ARS 的第三方平台与集成列在 THIRD_PARTY.md 中,均为社区提交,未经维护者审查或认可。
性能与成本
👉 docs/PERFORMANCE.md —— 每种模式的 token 预算、全流程估算(一篇 15,000 词的论文约 $4–6),以及推荐的 Claude Code 设置(Auto 模式;Agent Team 可选)。
指南与文章
- Academic Writing Shouldn’t Be a Solo Act — full pipeline walkthrough (English)
- 学术写作不该是一个人的事:一套开源 AI 协作工具如何改变研究者的工作流 — 完整使用指南(繁体中文)
功能概览
- Deep Research —— 13 代理研究团队,包含苏格拉底引导模式、PRISMA 系统评价、意图检测、对话健康监控、可选的跨模型 DA、Semantic Scholar API 验证。
- Academic Paper —— 12 代理论文写作,包含 Style Calibration、Writing Quality Check、LaTeX 加固、可视化、修改指导、引用转换、防泄漏协议,以及 VLM 图表验证。
- Academic Paper Reviewer —— 7 代理多角度同行评审,包含 0–100 质量评分标准(EIC + 3 个动态审稿人 + 魔鬼代言人)、让步阈值协议、攻击强度保持、可选的跨模型 DA 评论/校准、R&R 可追溯性矩阵、只读约束。
- Academic Pipeline —— 10 阶段流程编排器,包含自适应检查点、断言验证、Material Passport、可选的
repro_lock、可选的跨模型完整性验证、对话中途强化、以及分数轨迹追踪。 - Data Access Level Metadata(v3.3.2+)—— 每个技能声明
data_access_level(raw/redacted/verified_only);由scripts/check_data_access_level.py强制执行。模式改编自 Anthropic 的 automated-w2s-researcher(2026)。详见shared/ground_truth_isolation_pattern.md。 - Task Type Annotation(v3.3.2+)—— 每个技能声明
task_type(open-ended或outcome-gradable)。当前所有 ARS 技能均为open-ended。 - Benchmark Report Schema(v3.3.5+)—— JSON Schema + lint,用于诚实的基准比较。详见
shared/benchmark_report_pattern.md。 - Artifact Reproducibility Lockfile(v3.3.5+)—— Material Passport 上的可选
repro_lock子块。配置文档,非重放保证——LLM 输出不可按字节复现。详见shared/artifact_reproducibility_pattern.md。 - Model Tiering(#517, v3.16+)—— 可选的
ARS_MODEL_TIERING开关,包含两个方向:economy(执行型代理下放一个层级至会话模型以下,底线 Opus 级别)和quality-boost(完整性关卡和最终审阅处的判断型代理提升至前沿层级)。未设置时默认等同于 #517 之前的字节行为。详见shared/model_tiering.md。 - Experiment Provenance Intake(#260)—— Material Passport 上的可选
experiment_provenance[],记录学者 外部 运行的实验(ARS 从不运行实验),手稿断言通过claim_intent_manifest.planned_experiment_ids[]关联至这些实验。完整性关卡(第 2.5/4.5 阶段)针对每个实验支持的断言审计其声明的来源——结果为ALIGNED/OVERSTATED/NOT_SUPPORTED_BY_PROVENANCE/PROVENANCE_INSUFFICIENT——不判断实验本身是否正确。一个默认关闭的experiment_intake_declaration使“你是否运行了实验?”成为一个明确的第 1 阶段决策(即使是纯文献运行也要声明no_experiments_declared)。详见shared/handoff_schemas.md§“Experiment Provenance Intake (#260)”。
展示:真实流程输出
查看真实 10 阶段流程运行生成的完整工件——同行评审报告、完整性验证报告以及最终论文:
| 工件 | 描述 |
|---|---|
| 最终论文 (EN) | APA 7.0 格式,LaTeX 编译 |
| 最终论文 (ZH) | 中文版,APA 7.0 |
| 完整性报告——预审 | 第 2.5 阶段:捕获 15 个虚构引文 + 3 个统计错误 |
| 完整性报告——最终 | 第 4.5 阶段:确认零回归 |
| 同行评审第一轮 | EIC + 3 个审稿人 + 魔鬼代言人 |
| 再评审 | 修改后的验证 |
| 同行评审第二轮 | 后续评审 |
| 给审稿人的回复 | 逐点作者回复 |
| 发表后审计报告 | 独立全引文审计:发现 21/68 个被 3 轮完整性检查遗漏的问题 |
配套:实验代理
如果你的研究涉及在写作之前运行实验(代码或人类研究),Experiment Agent 技能填补了 ARS 第 1 阶段(研究)和第 2 阶段(写作)之间的空白。
ARS 第 1 阶段 研究 → 研究问题摘要 + 方法蓝图
↓
experiment-agent → 运行/管理实验 → 验证结果
↓
ARS 第 2 阶段 写作 → 使用已验证的实验结果撰写论文
功能:执行代码实验(Python、R 等)并实时监控,管理含 IRB 伦理检查表的人类研究方案,以 11 种谬误检测解释统计结果,并验证可复现性。
如何配合使用:在第 1 阶段后暂停 ARS 流程,在独立的 experiment-agent 会话中运行实验,然后将结果(附带 Material Passport)带回 ARS 第 2 阶段。ARS 无需任何修改。安装说明见 experiment-agent README。
阶段 1 摄入声明(#260):在阶段 1 中,ARS 会判断本次实验运行是否会携带实验支持的声明,并在材料护照上设置一个故障关闭的 experiment_intake_declaration。如果你的实验是外部运行的,学者需要为每个实验录入一个 experiment_provenance[] 条目(包含 experiment_id、嵌套的 repro_lock、planned_vs_executed[]、negative_results[]、known_limitations[]),并将声明设置为 experiments_declared;否则设置为 no_experiments_declared。每个 #260 之后的护照都必须包含该声明——即使不涉及任何实验的运行,也同样声明 no_experiments_declared,从而确保完整性关卡不会因为遗忘溯源块而被静默绕过。experiment_id 在此摄入点被冻结;后续编写者通过 planned_experiment_ids[] 引用它们。
教学端伴侣:Teaching Skills 将 ARS 架构(技能集、共享合约、分阶段关卡、课程护照)应用于学术生活的教学端——课程设计→课程环节→评估→交付→反思;其 sotl 模式将课堂探究项目移交给 ARS 深度研究/学术论文模块以进入发表阶段。
使用方式
快速开始
# 启动完整研究流程
你:“我想写一篇关于 AI 对高等教育质量保障影响的研究论文”
# 以苏格拉底式引导开始
你:“引导我研究 AI 在教育评估中的应用”
# 在引导式规划下撰写论文
你:“引导我写一篇关于人口下降的论文”
# 审阅一篇已有论文
你:“审阅这篇论文”(然后提供论文内容)
# 检查流程状态
你:“status”
单项技能
深度研究(8 种模式)
“研究 AI 对高等教育的影响” → 完整模式
“给我一个关于 X 的快速简报” → 快速模式
“对 X 进行 PRISMA 系统综述” → 系统综述模式
“引导我研究 X” → 苏格拉底模式(引导式)
“核查这些主张的事实” → 事实核查模式
“对 X 进行文献综述” → 文献综述模式
“以 WHY/HOW/WHAT 格式比较这些论文” → 三维扫描模式
“审阅这篇论文的研究质量” → 审阅模式
学术论文(11 种模式)
“写一篇关于 X 的论文” → 完整模式
“引导我完成论文写作过程” → 规划模式(引导式)
“构建论文大纲” → 仅大纲模式
“我已有草稿,这里有审稿人意见” → 修订模式
“将审稿人意见解析为改进路线图” → 修订教练模式
“为这篇论文写摘要” → 仅摘要模式
“将其转化为文献综述论文” → 文献综述模式
“转换为 LaTeX” / “将引文转换为 IEEE 格式” → 格式转换模式
“检查引文” → 引文检查模式
“为 NeurIPS 生成 AI 披露声明” → 披露模式
“对照审稿意见审计我的回复草稿” → 回复审计模式
学术论文审稿人(6 种模式)
“审阅这篇论文” → 完整模式(主编 + 审稿人1/2/3 + 魔鬼代言人)
“快速评估这篇论文” → 快速模式
“引导我改进这篇论文” → 引导模式
“检查方法论” → 方法论聚焦模式
“验证修订内容” → 再评审模式
“对照我的黄金标准校准这位审稿人” → 校准模式
学术流程(编排器)
“我想写一篇完整的研究论文” → 从阶段 1 开始的完整流程
“我已有一篇论文,请审阅它” → 从阶段 2.5 中间进入(先保证完整性)
“我收到了审稿人意见” → 从阶段 4 中间进入
流程以阶段 6:流程总结结束——自动生成论文创建过程记录,附带 6 维协作质量评估(1–100 评分)。
支持的语言
- 繁体中文(繁體中文)—— 当用户使用中文输入时默认
- 英语 —— 当用户使用英语输入时默认
- 学术论文的双语摘要(中文 + 英文)
使用其他语言? 苏格拉底模式(深度研究)和规划模式(学术论文)采用基于意图的激活——它们检测请求的含义,而非特定关键词。这意味着它们可以在任何语言下无需修改即可工作。
不过,通用的
触发关键词部分(决定技能是否被激活)仍然列出了英语和繁体中文关键词。如果你发现该技能在你的语言中无法可靠激活,你可以在每个SKILL.md文件的### 触发关键词部分添加你的语言关键词,以提高匹配置信度。
支持的引文格式
- APA 7.0(默认,包含中文引文规则)
- Chicago(注释 & 作者-日期)
- MLA
- IEEE
- Vancouver
支持的论文结构
- IMRaD(实证研究)
- 主题式文献综述
- 理论分析
- 案例研究
- 政策简报
- 会议论文
技能详情
每个智能体的职责和各阶段工件现已移至 docs/ARCHITECTURE.md。版本号在此处锚定,以便版本发布元数据保持集中。
深度研究(v2.11.0)
13 个智能体的研究团队。模式:完整、快速、审阅、文献综述、三维扫描、事实核查、苏格拉底、系统综述。完整智能体名册及工件:见 ARCHITECTURE.md 第3节。
学术论文(v3.2.0)
12 个智能体的论文写作流程。模式:完整、规划、仅大纲、修订、修订教练、仅摘要、文献综述、格式转换、引文检查、披露、回复审计。输出:MD + DOCX(可用时通过 Pandoc)+ LaTeX(APA 7.0 apa7 类 / IEEE / Chicago)→ 通过 tectonic 生成 PDF。完整智能体名册及各阶段职责:见 ARCHITECTURE.md 第3节。
学术论文审稿人(v1.10.0)
7 个智能体的多角度审阅,附带 0-100 质量评分标准。模式:完整、再评审、快速、方法论聚焦、引导、校准。决策映射: ≥80 接受,65-79 小修,50-64 大修,<50 拒稿。第一轮评审团队 vs. 窄范围再评审团队边界:见 ARCHITECTURE.md 第3节 阶段 3 / 阶段 3’。
学术流程(v3.16.0)
10 阶段编排器,包含完整性验证、两阶段审阅、苏格拉底式辅导和协作评估。流程保证:每个阶段均需用户确认检查点;完整性验证(阶段 2.5 + 4.5)不可跳过;R&R 可追溯性矩阵(模式 11)独立验证作者的修订声明。v3.4 在阶段 2.5 / 4.5 增加了合规智能体(PRISMA-trAIce + RAISE)。v3.5 在每个完整/精简检查点及流程完成时增加了协作深度观察者(collaboration_depth_agent,仅提供建议——绝不阻塞)。强制完整性关卡(2.5 / 4.5)明确跳过观察者,以免合规检查被稀释。 基于 Wang & Zhang (2026),IJETHE 23:11。包含智能体、工件和关卡的逐阶段矩阵:见 ARCHITECTURE.md 第3节。
v3.0 优化:关于 AI 结构性限制的新发现
发生了什么
在使用 ARS 撰写一篇关于高等教育中 AI 的反思文章时,我遇到了三个结构性限制,无论怎样优化提示词都无法解决:
-
框架锁定 (Frame-lock):我要求 AI 针对自身论点进行魔鬼代言人式辩论。它确实执行了——进行了四轮,且每轮都比上一轮更精细。但每一轮都停留在我设定的框架内。魔鬼代言人攻击的是论点,从未质疑前提。它从未问过“我们是否在讨论正确的问题?”这正是导致 v2.7 压力测试中出现 31% 引用错误率的相同模式:验证 AI 和生成 AI 共享相同的认知框架。
-
被反驳时的谄媚 (Sycophancy under pushback):每当我质疑魔鬼代言人的攻击时,它都太快让步了。它撤回结论的速度比提出结论还快。模型的训练奖励对话和谐——因此“用户反驳了”被当作攻击是错误的证据,而实际上往往只意味着用户很坚持。
-
意图误判 (Intent misdetection):苏格拉底式导师在我仍在探索时,就不断试图收敛并产出成果(“需要我整理成一个文件吗?”)。它无法区分“用户想要一场深入的哲学讨论”和“用户想要一份研究问题简报”。两者看起来都像是参与,但需要完全相反的 AI 行为。
我们改变了什么(v3.0)
魔鬼代言人——让步阈值协议 (deep-research + academic-paper-reviewer)
- 魔鬼代言人现在必须在回应前对每个反驳按 1-5 分评分
- 仅当评分 ≥4 时允许让步(反驳直接针对核心攻击并提供证据)
- 评分 ≤3:维持立场并重申原始攻击
- 反谄媚规则:不允许连续让步、追踪让步率、每个检查点后检测框架锁定
苏格拉底式导师——意图检测层 (deep-research)
- 对话开始及每 3 轮后,将用户意图分类为探索型或目标导向型
- 探索模式:禁用自动收敛,最大轮数提升至 60,禁止“需要我总结吗?”等提示
- 目标导向模式:标准收敛行为
- 反过早结束规则:探索模式下由用户决定何时停止
苏格拉底式导师——对话健康指示器 (deep-research)
- 每 5 轮进行一次静默自评,评估三个维度:持续同意、冲突回避、过早收敛
- 在检测到同意模式时自动注入挑战性问题
- 对用户不可见(防止游戏化),但会话后可查看日志
为何重要
这些优化并没有解决 AI 的结构性限制——而是让这些限制变得可见且可控。魔鬼代言人在被足够猛烈地反驳后仍会最终让步。苏格拉底式导师仍然会有一些收敛偏见。但现在有了明确的检查点,可以减缓谄媚、迫使魔鬼代言人证明让步的合理性、并防止导师在用户准备好之前就结束。
更深层的启示:AI 素养不是关于学会将 AI 当作工具使用、遵循伦理规则、或担心 AI 风险。而是关于深入参与 AI,以便你自己发现它的结构性限制——以及在此过程中你自己思维的限制。
许可证
本作品采用 CC-BY-NC 4.0 许可。
您可以自由地:
- 共享 — 复制并重新分发本材料
- 改编 — 在原有基础上进行重新混合、转换和创作
在以下条件下:
- 署名 — 您必须给出适当的署名
- 非商业性使用 — 您不得将本材料用于商业目的
署名格式:
基于 Academic Research Skills by Cheng-I Wu
https://github.com/Imbad0202/academic-research-skills
贡献者
Cheng-I Wu (吳政宜) — 作者与维护者
aspi6246 — 贡献者。v3.1 优化灵感来源于 Claude-Code-Skills-for-Academics 中的模式:只读约束模式、反模式的一等公民编码化、认知框架方法(教授“如何思考”而非仅仅是步骤)、以及精炼技能规模哲学。
mchesbro1 — 贡献者。最初提议并起草了用于 academic-paper-reviewer/references/top_journals_by_field.md 的 IS 8 期刊篮子 (Issue #5)。
cloudenochcsis — 贡献者。将 IS 部分从 Basket of 8 扩展到完整的 Senior Scholars’ Basket of 11 —— 增加了 Decision Support Systems、Information & Management 和 Information and Organization (Issue #7、PR #8)。来源为 AIS Senior Scholars’ List of Premier Journals。
eltociear (Ikko Eltociear Ashimine) — 贡献者。翻译了日文版 README (README.ja-JP.md) (PR #161)。
xpfo-go (xpfo) — 贡献者。翻译了简体中文版 README (README.zh-CN.md) (PR #181)。
devCharlotte — 贡献者。翻译了韩文版 README (README.ko-KR.md) (PR #469)。
Yaobin29 — 贡献者。在 PR #433 中提出审稿人回复工具;deep-research three-way-scan 模式和 academic-paper rebuttal-audit 模式(从该 PR 的 audit 概念中提取)在 v3.12.1 中整合自该贡献。
更新日志
v3.16.0 (2026-07-12) — 模型分层、跨模型关口加固、WP 建议优化
新增: 可选的模型分层 (#517) — 一个新的
ARS_MODEL_TIERING开关,有两个方向(economy将 13 个执行型代理放置在会话模型低一层,下限为 Opus 级;quality-boost将判断型代理在完整性关口和最终审查层提升到前沿层);默认未设置时保持字节等价,冻结的 39 个代理分类由新的清单 + 检查固定。跨模型关口加固 (#518) — 风险分层验证采样(高影响力参考文献在两个关口 100% 验证)、两个不可逆决策(设计冻结 + 最终编辑决策)时的盲分歧检查点、验证器模型 ID 的 ID 状态白名单、以及晋升竞赛协议;原计划中的通用第 6 审稿人已被退役而非推迟。GPT-5.6 Sol 被列为临时跨模型验证器,并带有明确的推理努力控制 (#515)。devCharlotte (#452/#509) 贡献的韩语触发关键词 + 路由边界固定装置。为论文写作者新增 CARS 引言修辞 + 标题构思参考 (#500)。变更: WP 研究问题建议通过名词替换测试 (#501) 及其增强的豁免条款(捕获装饰性标题形式 shell (#505)),超越了其 20 条 shell 表格 —— 保留样本错误率从 0.34–0.38 降至 0.094,且误报率 0/16 保持不变;审稿人校准协议现在记录了 LLM 作为法官的宽松方向(FARS 锚点,#484);OpenAlex API 密钥认证 + 预算感知的 429 处理 + arXiv ToU 一致的回退 (#495/#496)。文档: THIRD_PARTY.md 社区目录 (#497/#498)。academic-pipeline跟踪套件版本 v3.16.0;其他三个技能版本未变。
v3.15.0 (2026-07-04) — 发布门控强化、提示债务清偿第2轮、碎片锁定
这是一次发布纪律与卫生的发布;无技能行为变化。新增: 三个 CI 门控——覆盖合并的 CHANGELOG 预标签门控 (#483)、版本一致性不变量 9-11 及标签时重新运行门控 (#487)、以及一个命令不变量门控,将 SessionStart 公告列表固定到实际的 16 个命令清单 (#486)——加上两个碎片锁定:“阶段边界实施语句”在所有 23 个 Bucket A 智能体块中逐字固定,SETUP 跨模型示例相互固定并固定到规范模型表 (#491 → #492)。变更: 提示债务清偿第2轮深度扫描了第一轮推迟的 17 个智能体 (#489 → #490):两个实时自相矛盾在 socratic_mentor 智能体中修复(过时的 15 轮退出规则与文档中典型的 20-30 轮运行不符),全仓库范围内过时的实施状态语句在 29 个表面修正,7 个智能体中的少样本和冗余流程脚手架被修剪——通过 4 批并行审计+独立法典跨模型挑战验证;审计报告见
audits/。修复: 来自 shields.io 的 DOI 徽章 (#482)。academic-pipeline跟踪配套版本 v3.15.0;其他三个技能版本不变。
v3.14.0 (2026-07-02) — Claude Science 可导入性、评估注释渲染、提示债务清偿
一次可移植性与打磨发布;无技能行为变化。新增: Claude Science 可导入性——市场清单声明了明确的技能路径,因此无法遍历符号链接
skills/目录的 GitHub API 导入器(Claude Science “从 GitHub 导入”,Windows 检出)现在可以找到所有四个技能;在 Claude Science 上端到端验证,README + SETUP 中包含导入指南 (#480)。评估工具 PR 注释现在渲染为一行结论 + 每个任务表格,原始 JSON 折叠在<details>中,替换原始报告转储——仅显示层,门控逻辑字节相同 (#479)。变更: 在 2026-07 工具退役审计后,四个编写界面智能体中的过期编写脚手架已被移除 (#476/#477 → #478,净减少 111 行提示);一个”提醒而非阻止”的平台端口提醒,当 PR 添加新的顶层目录时提示平台端口策略 (#473)。文档: 由 devCharlotte 完成的母语韩语 README (#469/#471);GitHub Copilot 仓库说明 (#465);推荐自动权限模式而非跳过权限模式 (#464)。累积的[Unreleased]积压(16 个条目,其代码在 v3.13.0 标签之前已发布——差异/补丁修订模式 #390、提交包验证器 #394、评估黄金集 #215/#216 等)已纳入版本化记录;见CHANGELOG.md。academic-pipeline跟踪配套版本 v3.14.0;其他三个技能版本不变。
v3.13.0 (2026-06-18) — 钩子可移植性、提供商无关验证、守卫正确性
一次小版本发布,强化了安装/运行时表面并扩展了跨模型覆盖范围。修复: 写入范围守卫不再在 git 克隆 + 符号链接安装布局下错误拒绝用户自己的
CLAUDE.md(#459,关闭了 #448/#449 的剩余一半——CLAUDE.md是文档,不是承载性执行文件,因此它离开基础设施保护列表,而所有承载性文件保持受保护);Windows Python 钩子可移植性 + 通过跨平台hooks/run_guard.sh启动器实现优雅的无 Python 降级,该启动器拒绝 Microsoft Store 的 0 字节python3存根并且从不向钩子日志发送垃圾信息 (#454);draft_writer双阶段静态联合已文档化 + POSIX 安全的 Windows 路径匹配 (#451)。新增: 提供商无关的跨模型验证,接受 OpenAI 兼容端点(MiMo、DeepSeek、自托管)以及基础的一手 OpenAI,后者永远不会被静默降级 (#455);一个可选择加入的苏格拉底邻域探索提示(借用 STORM 的视角扩展,ARS_SOCRATIC_ADJACENT_PROBE=1,默认关闭,仅限文本层——deep-research2.10.0 → 2.11.0)(#461)。academic-pipeline跟踪配套版本 v3.13.0;academic-paper和academic-paper-reviewer不变。每个问题的详细内容见CHANGELOG.md。
v3.12.1 (2026-06-15) — 审稿人回复分诊模式(PR #433 集成)
一个补丁发布,将外部贡献中真正新颖的部分以模式形式整合到现有技能中,遵循 ARS 的基于模式的架构。新模式:
deep-researchthree-way-scan——在quick和lit-review之间的轻量级 WHY/HOW/WHAT 论文比较分诊,带有每篇论文的短名单 + 跨论文综合(deep-research2.9.4 → 2.10.0);academic-paperrebuttal-audit——对作者现有的反驳/回复草稿针对审稿人意见进行独立的咨询性 QA(每评论覆盖表格 + 差距列表 + 语气/证据/误读风险标志),该模式不生成任何内容,并在独立运行时显式抑制 Schema 11 / Material Passport 写入 /ready_to_submit(由带有突变覆盖的check_rebuttal_audit_guard()检查强制执行);以及revision-coach范围扩展至反驳/异议姿态和非期刊范围,以及/ars-3w+/ars-rebuttal-audit斜杠命令。根据输入形状路由:审稿人意见 + 草稿 →rebuttal-audit;仅审稿人意见 →revision-coach。从 @Yaobin29 的 PR #433 集成。配套模式计数从 25 增加到 27(仍然是 4 个技能)。每个问题的详细内容见CHANGELOG.md。
v3.12.0 (2026-06-08) — Kong 自动研究功能轨道:实验溯源、图形保真度、跨论文矛盾、部分证据分解
一次小版本发布,交付了 Kong 等人(2026, arXiv:2605.18661)的自动研究功能轨道,以及部分证据陷阱分解工作,每项工作均经独立审查和合并。新功能: 实验溯源摄入 + 声明→实验对齐——针对实验支持的声明的基于 schema 的证据账本层,仅摄入和对齐(学者外部运行实验;ARS 从不执行实验)(#260);图/表保真度门控,检查图注的解释是否源自数据,以及稿件是否引用该工件来支持其主张 (#261);结构化跨论文矛盾清单,使评估的论文对可枚举以供学者确认 (#262);以及在引用判断器 (#213) 和编辑综合器 (#214) 中在判断前进行子声明分解,关闭了两个层上的 §F.3.2 部分证据陷阱。指导 + 解释层: 在生成报告的审稿人中进行简洁输出 + 压力稳定边界强化 (#274);同族/基于评分的校准认知注释 (#273);检索内容/数据边界作为持续原则陈述 (#367)。否定范围: Kong META (#255) 以
POSITIONING.md中的 “被拒绝的机制” 部分关闭,列举了 ARS 不执行的五种自主机制,以及两个 Tier D 设计教训文档。发布纪律检查: 版本一致性不变量 5–7 (#357) 和 ARCHITECTURE 组件版本审查 (#345)。以及跨模型基础守卫的正确性修复 (#346 / #349 / #351)、引用门控缓存键和理由边界 (#359 / #360 / #361)、评估黄金集 (#250) 以及 ACL/EMNLP 披露重新基础 (#242)。新 schema、清单字段和所有不变量是叠加性的且向后兼容。academic-pipeline跟踪配套版本 v3.12.0;其他三个技能版本不变。每个问题的详细内容见CHANGELOG.md。
v3.11.1 (2026-06-06) — 发布后正确性、加固与溯源汇总
一个补丁版本,汇总了 v3.11.0 之后出现的发布后修复,每项修复均已独立审查并合并:跨模型同意门(consent-gate)扩展至完整性验证 + 协作深度路径(#322)、每条记录的 OpenAlex + Crossref 回填并行化(#138),以及涵盖引用存在门(citation-existence gate)、v3.10 策略层、评估测试平台(eval harness)、领域证据画像(domain evidence profiles)以及 #310 安全边界边缘情况(#323 / #327 / #328 / #329 / #331 / #332 / #333)的七项正确性/加固修复——包括两个 P1 修复(#327 无交接路径上的领域画像激活,#328 评估测试平台每类阈值门)。无新功能,无破坏性模式变更。详见
CHANGELOG.md中各 issue 详情。
v3.11.0 (2026-06-04) — 确定性引用验证门 (#182)
新增一个确定性引用存在验证门,独立于 LLM 同行评审运行。每条被引参考文献最多与四个文献索引进行交叉核对——Semantic Scholar + OpenAlex + Crossref + 新增的 arXiv 解析器(
scripts/arxiv_client.py,无需 API 密钥)——并将每条引用的lookup_verified状态({true, false, unresolvable})写入统一摘要,从而通过查询而非依赖审稿 Agent 来捕获带有明显虚假 DOI/arXiv ID 的捏造引用。该门继承 v3.10 的terminal_policies选择加入模型:检测始终运行,但lookup_verified == false的行仅在用户选择terminal_policies.citation_existence == strict时才成为终止性条件——默认行为是建议性的,可通过/ars-mark-read确认。false被限定为按 ID 键值匹配失败(精确 DOI/arXiv 查询证明失败),因此合理但未索引的人文学科/非英语/地区性引用保持unresolvable状态且永不阻塞(有记录的精度优先于召回率的权衡)。附带持久 SQLite 验证缓存(~/.cache/ars/verification.db,90 天 TTL)以及/ars-cache-invalidate命令、独立的verification_gateAPI +verify_passport.pyCLI,以及 v3.9.0 污染三角矩阵的四索引扩展(k=0..4,均为建议性)。academic-pipeline跟踪套件至 v3.11.0;其他三个技能版本不变。规范:docs/design/2026-05-21-v3.10-182-promote-citation-gate-spec.md(§0 修正 + C-V6)。
v3.10.0 (2026-06-01) — 三角策略层、Kong 调查采纳、评估测试平台、作用域写入守卫
次要版本整合:污染-三角的终止性策略层选择加入(#127——默认引用行为字节级等同于 v3.9.0);Kong et al. 2026 调查采纳——答辩承诺分类账(#256/#266/#268/#269)与学科相对领域证据画像(#259);v3.10 测量基础设施——通用评估黄金集 + 排名提升 CI 门(#184);作用域写入守卫 MVP(#134)——一个确定性
PreToolUse钩子,将 23 个单阶段 Agent 限制在其自身阶段目录内,并禁止其使用 Bash(它们改用 Grep/Glob 与结构化编辑工具);/ars-mark-read插件命令(#190)加上一个到场即损坏的修复(#195);简体中文 README(#185);以及 CI 加固(#156/#155)。academic-paper→ v3.2.0,academic-paper-reviewer→ v1.10.0 以支持承诺分类账和领域画像新增项;academic-pipeline跟踪套件至 v3.10.0。除非选择严格策略模式,否则默认技能行为不变;唯一默认开启的变更是 #134 守卫,它约束的是被围栏的子 Agent,而非面向用户的输出。
v3.9.4.2 (2026-05-19) — 针对 PR #149 CI 纪律门(codex 发布后)的发布后热修复
对 PR #149(7 个 CI 纪律门)的 Codex 发布后审查发现了 4 个 P2 发现项;v3.9.4.2 加固了其中 3 个。F1:
harness-retirement-monthly.yml添加GH_REPO以使定时运行拥有仓库上下文来执行gh issue create。F2:release-cooldown.yml将PREV_TAG查找过滤为v*标签,以防止非发布标签绕过冷却期。F3:release-cooldown.yml同时读取带注释标签的主体,并接受hot-fix拼写(v3.9.2 此前为假阴性热修复)。PR #157 后续:[skip-cooldown]重写现在同时从提交信息和带注释标签信息中读取(自举修复——此标签的冷却绕过证明 F2+F3 端到端工作)。F4(测试计数单调加固)被还原,因为它暴露了预先存在的scripts/包问题,记录为 #154(已由 PR #158 修复)+ 重试 #155。关闭 #152。后续: #155, #156。
v3.9.4.1 (2026-05-19) — 针对 v3.9.4 时间验证(#135 codex 发布后)的发布后热修复
对 v3.9.4 的 Codex 发布后审查发现了 4 个真实错误,是每个任务子 Agent 审阅者遗漏的。热修复修补了全部 4 个错误:(1)
audit()现在将citation_provenance接入 P2 和 P4——当引用片段(ref slug)具有confidence: low或conflict时,验证器发出TEMPORAL-METADATA-MISSING而非使用时间线日期作为真实基准(规范 §3.4 第一方安全检查此前有缺陷)。(2)_date_to_interval解析所有模式有效日期形状,包括YYYY-MM(Crossref 月份精度)和YYYY-MM-DD..YYYY-MM-DD(区间);v3.9.4 对这些情况静默地ValueError并跳过检查。(3) P4 现在在缺失引用标记时绑定直接日期捕获——类似 “The 2026 policy enabled the 2020 rollout” 的句子现在实际被触发。(4)citation_provenance.schema.json中confidence:high的 allOf 现在要求存在性(then.required)而非仅仅非空,从而修复了缺少属性的绕过。1561 个测试通过(对比 v3.9.4 基准新增 12 个,0 回归)。ARCHITECTURE.md已更新至当前状态(此前停留在 v3.8.0 的陈旧版本)。
v3.9.4 (2026-05-18) — #135 时间验证层(建议性)
在阶段 4→5 边界处的确定性建议性验证器,覆盖 5 种时间失效模式(P1 回顾性算术、P2 时代误植引用、P3 比较器未具体化、P4 因果倒置、P5 指示性现在)。新增阶段 2 同级 Agent
timeline_extraction_agent拥有phase2_investigation/timeline.yaml+phase2_investigation/citation_provenance.yaml。验证器脚本scripts/temporal_integrity_audit.py确定性运行 5 个遍历。M3 时间完整性铁律添加至report_compiler_agent+draft_writer_agent。M6-最小:Crossrefissued+ pdftotext 覆盖第一方验证。M7-最小:日期来源 + 比较器具体化。M5-存根:仅用户声明的version_family_id。literature_corpus_entry、claim_audit_result、claim_intent_manifest零修改。bibliography_agent未修改(F2 不变量)。3 个新的侧车模式。覆盖率估计:55-70% 基准 / 65-75% 带 M7 最小。1549 个测试通过(新增 44 个,0 回归)。
v3.9.3 (2026-05-18) — #128 内务整理(共享客户端工具 + 去重解析器)
纯重构 + 来自 v3.9.0
/simplify审查积压的一个潜在错误修复。提取了scripts/_text_similarity.py(3 路客户端去重:标准化/相似度/阈值/重试常量)+scripts/_passport_yaml.py(2 路迁移工具去重:ruamel.yaml round-trip 配置)+ 私有_resolve_by_doi_then_title辅助函数(2 路解析器主体去重,保留 §3.4 / §3.5 API 表面)。跨 OpenAlex + Crossref(此前为time.time,NTP 不安全)的节流测量标准化为time.monotonic,与 Semantic Scholar 保持一致。所有 5 个模块级交叉导入均采用双路径导入基础设施(同级优先,命名空间包回退),从而为SemanticScholarUnavailable保留了类身份,并额外修复了 2 个潜在失效的import scripts.X路径。1505 个测试通过(新增 23 个,0 回归)。#128 §4(每条记录并行化 OA + CR)转至 #138。
v3.9.2 (2026-05-18) — #133 阶段边界热修复
#133 关闭(热修复层)。长期架构修复追踪为 #134 中的 v3.10 活动指导器。新增:CLAUDE.md 中的路由澄清门(跨阶段材料 → 使用 a-d 选项澄清,而非静默分发),22 个单阶段智能体获得提示硬围栏(
## Phase Boundary (v3.9.2)),16 个多阶段/阶段正交/跨阶段元智能体故意不加围栏(诚实框架——散文安慰剂会造成虚假执行错觉),咨询验证器scripts/check_pipeline_integrity.py事后检测 #133 模式。行为冒烟测试与跨模型抽查(100% Opus 4.7,≥75% Sonnet + GPT-5.5)。
v3.9.1 (2026-05-18) — #129 + #130 客户端加固
v3.9.0 热修复。将 OpenAlex / Crossref 响应读取失败包装为
*Unavailable(#129);保护check_claim_audit_consistency免受非字符串manifest_id影响(#130)。无规范变更。
v3.9.0 (2026-05-17) — #102 跨索引三角测量
#102 关闭。v3.7.3 发布了单索引(Semantic Scholar)污染检测;v3.9.0 扩展至三索引三角测量(S2 + OpenAlex + Crossref)作为仅咨询证据。
contamination_signals上新增两个可选布尔字段(openalex_unmatched、crossref_unmatched);手动输入不匹配规则对称扩展。终结器新增四层咨询矩阵(在出现的*_unmatched字段上计算 k=0/1/2/3),并保留 v3.7.3 遗留的CONTAMINATED-UNMATCHED用于 k=1/k_max=1 的仅 S2 情况。格式化器直通白名单从 3 后缀扩展至 9 后缀;拒绝规则 1-10 根据 R-L3-2-E 保持不变。策略层(严格模式、硬阻塞层级、venue_type/triangulation_policy)推迟至 v3.10,详见规范 §2.3。k=3 标记为CONTAMINATED-TRIANGULATION-UNMATCHED(描述可观测现象,而非推断原因)。3 条新固定规则:R-L3-2-C(在出现的字段上计算 k)、R-L3-2-D(无 API 推断分类)、R-L3-2-E(拒绝列表不变;直通白名单扩展)。
迁移: v3.7.3 语料库 — 运行 python scripts/migrate_literature_corpus_to_v3_9_0.py PATH 以回填两个新字段。v3.7.3 之前的语料库 — 先运行 migrate_literature_corpus_to_v3_7_3.py,然后再运行 v3.9.0 迁移(按规范 §3.7 链式执行;v3.9.0 工具仅作用于已携带 contamination_signals.semantic_scholar_unmatched 的条目)。
v3.8.2 (2026-05-17) — #118 未引用审计工具故障表面
#118 关闭。
ARS_CLAIM_AUDIT=1未引用约束判断路径在遇到JudgeInvocationError时曾静默替换为{"judgment": "NOT_VIOLATED"},从而在法官瞬时故障时压制 HIGH-WARN 约束检查。v3.8.2 将这些故障路由至专用的uncited_audit_failures[]聚合(MED-WARN 咨询层),镜像已引用路径 INV-14 行,但使用专用模式,因为claim_audit_result.ref_slug是必填字段且未引用路径没有可绑定的引用。#118 问题正文中的四个选项 1..4 权衡最终落在选项 2(新聚合)——选项 4(重新抛出并中止)因在不稳定的法官端点上的审计覆盖率损失而被拒绝。
- 新增
uncited_audit_failure.schema.json聚合(规范 §3.6)。每个未引用句子 × 清单对一条记录,当约束法官抛出JudgeInvocationError时。与已引用路径 INV-14 相同的故障类枚举(judge_timeout/judge_api_error/judge_parse_error/cache_corruption/retrieval_api_error/retrieval_timeout/retrieval_network_error)。rule_version: D4-c-v1-uaf-v1。 - UAF-INV-1..UAF-INV-6 检查(规范 §6 规则 4d)。
finding_id唯一性、scoped_manifest_id跨数组完整性、当manifest_claim_id非空时 (M, C) 对完整性、每个 (句子, 清单) 去重、理由的 fault_class 前缀、跨聚合互斥性 vsconstraint_violations[]。 - 终结器 §5 MED-WARN 咨询行:注释
[CLAIM-AUDIT-TOOL-FAILURE-UNCITED — <fault-class>],门通过(重试下一轮修复)。格式化器 REFUSE 列表不变——UAF 是咨询性的。 - 流水线集成(
scripts/claim_audit_pipeline.py):删除第 1211-1224 行处的吞异常点;JudgeInvocationError现在发出一个 UAF 行并continue到下一个 (句子, 清单) 对。无伪造的 NOT_VIOLATED 进入constraint_violations[]。 - 测试:新增 18 个(15 个模式/检查 TSUAFUncitedAuditFailureInvariants + 3 个流水线集成 TP23UncitedJudgeOutageEmitsUAF)。测试基线从 694 增至 712,0 回归。
- 智能体文档(
academic-pipeline/agents/claim_ref_alignment_audit_agent.md):输出发射表增加第七行;错误处理表从 3 个表面增至 4 个表面,新增未引用路径 UAF 行。
v3.8.0 (2026-05-16) — L3 声称忠实性定位器 + 审计(配对里程碑)
v3.7.3 + v3.8 端到端填补 L3(声称忠实性)空白。v3.7.3 发布定位器基础设施——每个引用携带一个三层锚点,以便未来审计可以获取引用的段落。v3.8 发布审计步骤,消费这些锚点,判断引用来源是否支持声称,并在格式化器终端硬门处门控拒绝 HIGH-WARN 违规。该版本还捆绑了自 v3.7.0 以来积累的 5 个审计跟踪推送特性 PR(#104 / #105 / #108 / #111 / #115)。
- #103 —
claim_ref_alignment_audit_agent(v3.8 PR #121)。可选(ARS_CLAIM_AUDIT=1,默认关闭)阶段 4→5 审计智能体。判断每个抽样引用与检索到的摘录;发出claim_audit_results[]+claim_intent_manifests[]+claim_drifts[]+uncited_assertions[]+constraint_violations[]聚合。8 行终结器矩阵将 HIGH-WARN 类(CLAIM-NOT-SUPPORTED / NEGATIVE-CONSTRAINT-VIOLATION / FABRICATED-REFERENCE / ANCHORLESS / CONSTRAINT-VIOLATION-UNCITED)路由到格式化器 REFUSE 规则 6-10。校准运行器附带 20 元黄金集(T-C1 FNR<0.15 + FPR<0.10,T-C2 每类,T-C3 形状完整性)。8 轮双轨审查(R1 codex + Gemini-3.1-pro-preview,Gemini 配额用尽后 R2-R8 仅 codex);轨迹 R1 4P1+2P2 → R8 0P1+4P2 发布门。 - v3.7.3 — 三层引用发射 + 污染信号(PR #98)。
synthesis_agent/draft_writer_agent/report_compiler_agent获得## Three-Layer Citation Emission (v3.7.3)H2。每个<!--ref:slug-->携带<!--anchor:<kind>:<value>-->,其中<kind> ∈ {quote, page, section, paragraph, none}(引用锚点限制为 25 词,URL 编码)。pipeline_orchestrator_agent终结器变为 5 单元格,带有优先级零的 NO-LOCATOR 检查。formatter_agent添加显式硬门拒绝[UNVERIFIED CITATION — NO QUOTE OR PAGE LOCATOR]。literature_corpus_entry.schema.json添加可选contamination_signals: { preprint_post_llm_inflection, semantic_scholar_unmatched }对象。bibliography_agent在摄入时计算两个信号。11 轮审查轨迹(Codex×10 + Gemini 跨模型×1)关闭 22 个发现。规范:docs/design/2026-05-12-ars-v3.7.3-claim-faithfulness-and-contaminated-source-spec.md。外部动机:Zhao 等人 arXiv:2605.07723(2026-05)。 - #108 — AI 披露策略锚点渲染器(审计跟踪推送 2026-05-14)。在现有场地跟踪渲染器之外,新增 PRISMA-trAIce / ICMJE / Nature / IEEE 策略锚点披露路径。
- #111 —
slr_lineage在系统综述→学术论文交接时发射(2026-05-15)。模式 9 可选布尔字段slr_lineage;生产者pipeline_orchestrator_agent在每个交接转换时写入;消费者disclosure模式根据 §4.3 G2 不变量跟踪门分发--policy-anchor=prisma-trAIce。 - #104 — README 动机:Zhao 等人语料库规模证据锚点(2026-05-15)。README +
README.zh-TW.md动机部分将 v3.7.x 系列置于 Zhao 等人 146,932 个幻觉引用发现的背景下。 - #105 — v3.7.3 contamination_signals 回填迁移工具(2026-05-15)。
scripts/migrate_literature_corpus_to_v3_7_3.py对所有 v3.7.3 之前的通行证进行回溯计算两个污染信号。 - #115 — Semantic Scholar 客户端成熟(2026-05-15)。
scripts/semantic_scholar_client.py新增 1 请求/秒的节流(当检测到S2_API_KEY时降至 0.1 秒)、URLError 上的停机闭锁,以及用于长时间运行的跨通行证批处理的reset_outage_latch()。
v3.7.0 (2026-05-05) — Claude Code 插件打包
插件打包升级:ARS 现在可以通过
/plugin marketplace add Imbad0202/academic-research-skills+/plugin install academic-research-skills在 Claude Code CLI / VS Code / JetBrains 中一键安装。传统的git clone + 符号链接到 ~/.claude/skills/流程仍然有效——两条路径均为一等公民。
- 插件清单 + 市场元数据 (阶段 1, PR #68)。
.claude-plugin/plugin.json声明了套件(4 个技能通过相对符号链接从skills/目录自动发现)。.claude-plugin/marketplace.json注册了插件,使得单个 GitHub 托管的端点同时提供市场列表和插件源代码。README +README.zh-TW.md+docs/SETUP.md包含双轨安装说明。 - 10 个斜杠命令 位于
commands/ars-*.md(阶段 2.1, PR #69),将MODE_REGISTRY.md条目映射到/ars-<mode>触发方式。每个命令的前置元数据中固定了模型路由——full和revision-coach使用opus(架构性/评审解释深度),其余 8 个使用sonnet。根据项目策略,不使用Haiku。 - 3 个插件自带代理 位于
agents/*_agent.md(阶段 2.1, PR #69),作为相对符号链接指向deep-research/agents/中已通过 v3.6.7 加固的下游代理:synthesis_agent、research_architect_agent、report_compiler_agent。保留下划线文件名,以保持scripts/check_v3_6_7_pattern_protection.py的硬编码路径和 INV-3 清单约束的 Clause 1 不变性。符号链接(而非副本)保留了单一信息源,并防止了 v3.6.7 §6 反转扫描 + INV-1/2/3 检查所关闭的 Pattern C3 攻击面。(在 #413 中实现为真正的字节相同副本——相对符号链接在未设置core.symlinks的 Windows 检出和压缩包下载安装时会失效;单一信息源保证已转移到scripts/check_agents_mirror_sync.py的字节相等性 CI 检查。) model: inherit添加到上述三个源代理的前置元数据中。选择inherit而非固定为sonnet,以便运行 ARS 完整流水线的opus会话能够保留opus代理(而不会被降低上限)。用户的~/.claude/hooks/warn-agent-no-model.shPreToolUse 钩子在调度边界拦截Haiku,因此inherit通过一个已经过滤了Haiku的模型进行解析。- SessionStart 通告钩子 位于
hooks/hooks.json+scripts/announce-ars-loaded.sh(阶段 2.2, PR #70)。当插件加载时,该钩子会向 LLM 的第一次交互注入一个additionalContext,列出 10 个斜杠命令、3 个插件代理以及一个代币预算指针。startup和clear源值触发完整通告;resume和compact只触发一行确认,以避免消耗上下文。兼容 Bash 3.2——可在 macOS 自带的/bin/bash上运行,无需brew install bash。 - 阶段 2.2 范围缩减:
SubagentStop → run_codex_audit.sh代码审查钩子因以下原因被排除在 v3.7.0 之外:合同缺口(SubagentStop载荷不携带阶段/交付物信息,因此包装器不得不半推断所需参数)以及调用者类边界(run_codex_audit.sh第 4–7 行禁止在同一会话内由 LLM 调用;PostToolUse在产生会话内部触发)。真正的审查钩子集成将推迟到未来发布版本,届时 ARS 将拥有阶段/交付物传播合同。参见docs/design/2026-04-30-ars-v3.7.0-plugin-packaging-roadmap.md2026-05-05 更新说明(阶段 2.2 范围缩减)。 docs/PERFORMANCE.md+.zh-TW.md增加了“v3.7.0 插件代理与模型路由”小节,解释inherit语义及当前 3 代理的范围边界。- 三个 PR 的 Codex 审查链:8 轮内联迭代审查 + 3 轮新的 PR 级别审查,所有审查在合并前均达到 0 个 P0/P1/P2 发现。阶段 2.2 的新 PR 审查发现了一个内联审查遗漏的 P2 问题(未引用的
${CLAUDE_PLUGIN_ROOT}会在包含空格的安装路径中引发问题)——这证实了将实现审查(内联)与合同审查(新)分开的价值。 - 未变更的内容:四个技能目录、所有 25 个模式、代理提示、模式文件和检查合同。插件打包仅添加了新的顶层表面(
commands/、agents/、hooks/、.claude-plugin/、skills/符号链接目录、三个插件代理的model: inherit前置元数据添加)。现有的 4.3k 克隆安装用户不会看到任何破坏性变更。
v3.6.8 (2026-05-03) — 生成器-评估器合同门 (v3.6.6 规范发布)
命名说明:本次版本发布了 v3.6.6 生成器-评估器合同 规范及实现。 v3.6.6 的工作因项目顺序在 v3.6.7 之后落地;设计文档保留了 v3.6.6 作为合同门版本的内部命名, 而套件版本标记为 v3.6.8 以保持 CHANGELOG 单调递增。
- Schema 13.1 (
shared/sprint_contract.schema.json) 在 Schema 13 的基础上扩展:新增两个mode枚举值(writer_full+evaluator_full)、两个新的可选顶层字段(仅 writer 使用的pre_commitment_artifacts、仅 evaluator 使用的disagreement_handling)以及 12 个allOf分支,用于强制评审者/写作者/评估者有条件的门控。现有的评审者合同在 Schema 13.1 下验证为字节相同(§3.6 零接触承诺)。 - 两个新增的已发布合同模板,位于
shared/contracts/writer/full.json(D1–D7, F1/F4/F2/F3/F0)和shared/contracts/evaluator/full.json(D1–D5, F1/F2/F3/F6/F4/F5/F0)。这些模板从规范分支上的设计时工件提升为实时发布状态,与 Schema 13.1 升级原子同步。 - 两阶段编排 在
academic-paper full内部:阶段 4 拆分为阶段 4a(写作者在未看论文前进行预承诺)和阶段 4b(写作者查看论文后进行草稿生成并自我评分);阶段 6 拆分为阶段 6a(评估者在未看论文前进行预承诺)和阶段 6b(评估者查看论文后进行评分并做出决策)。带有阶段编号的<phase4a_output>/<phase6a_output>数据分隔符与 v3.6.2 的评审者模式保持一致。检查数量汇总:写作者 3+4 / 评估者 5+5 / 评审者 5+6(评审者保持零接触)。 academic-paperSKILL + 代理文件 增加了逐字复制的## v3.6.6 生成器-评估器合同协议代码块(SKILL.md 中 101 行,draft_writer_agent.md中 47 行,peer_reviewer_agent.md中 57 行)。SKILL.md 还新增了## 已知限制小节,包含针对 v3.6.7+ 的优雅降级和跨会话恢复的前向说明。- 验证器扩展:
scripts/check_sprint_contract.py新增了 SC-* 模式门控审计(SC-5 + SC-11 仅限评审者;SC-9 扩展到所有三类模式)。17 个新测试将验证器单元测试数量从 54 增加到 71(正向测试 + 5 个模式分支负向测试 + 2 个 §3.6 评审者回归测试 + 6 个模式门控测试)。 - 清单 CI 检查:
scripts/check_v3_6_6_ab_manifest.py在tests/fixtures/v3.6.6-ab/manifest.yaml上强制执行 §6.2 清单模式 + §6.5 git 跟踪的不变性。.github/workflows/spec-consistency.yml将 sprint 合同验证循环扩展,在现有的评审者循环之外额外迭代写作者和评估者模板目录,并运行新的清单 CI 检查。 - A/B 证据固定桩 位于
tests/fixtures/v3.6.6-ab/(30 个文件):清单 + README + 6 个论文 A 输入/基线 + 1 个论文 C 输入/基线 + 阶段 3 评审者摘录 + 6 个 codex 判断基线占位符。真实的固定桩数据将在后续提交中填充,直至实现工作完全完成。
v3.6.7 (2026-04-30) — 下游智能体模式保护(步骤 1+2)
- 三个下游智能体针对 17 个已记录的幻觉/漂移模式中的 13 个进行了加固:
synthesis_agent(A1–A5 叙事侧)、research_architect_agent的 survey-designer 模式(B1–B5 工具侧)、以及report_compiler_agent的 abstract-only 模式(C1–C3 发布侧)。每个智能体提示现在都带有一个PATTERN PROTECTION (v3.6.7)块。 shared/references/中的四个参考文件:irb_terminology_glossary.md、psychometric_terminology_glossary.md、protected_hedging_phrases.md、word_count_conventions.md。这些参考文件携带了智能体提示通过路径引用的操作契约。- 跨模型审计提示模板 位于
shared/templates/codex_audit_multifile_template.md,包含七个审计维度,以及针对report_compiler_agent捆绑包的强制性三部分 Section 4(f) 检查。任何子检查失败都视为 P1 发现。 - 静态 lint + 29 测试变异套件:
scripts/check_v3_6_7_pattern_protection.py强制执行保护子句存在性和义务短语格式;scripts/test_check_v3_6_7_pattern_protection.py保存 codex 审查证据,以便未来检查器回归在 CI 中显现。两者都已接入.github/workflows/spec-consistency.yml。 - Codex 审查历史:七轮
gpt-5.5+xhigh跨模型审查达到 SHIP-OK,零 P1+P2 发现。步骤 6(编排器运行时钩子)和步骤 8(合成评估案例)将在后续 PR 中发布。
v3.6.5 (2026-04-27) — 材料护照 literature_corpus[] 消费者集成
- 两个 Phase 1 文献消费者已接入:
deep-research/agents/bibliography_agent.md和academic-paper/agents/literature_strategist_agent.md。两者都遵循相同的五步 语料库优先、搜索补缺 流程(当护照包含非空literature_corpus[]时),并遵循相同的四条铁律(相同标准 / 无静默跳过 / 无语料库变异 / 解析失败时优雅回退)。 - 搜索策略报告中的预筛选可复现块:枚举包含/排除/跳过的语料库条目,附带 F3 零命中注释和 F4a–F4f 来源报告,这些报告围绕
obtained_via/obtained_at的部分声明进行组合。final_included = pre_screened_included[] ∪ external_included[]保持中立——参考文献条目或文献矩阵行上无来源标签。 - 消费者协议参考 位于
academic-pipeline/references/literature_corpus_consumers.md,包含规范预筛选模板、BAD/GOOD 示例、四条铁律以及每个消费者的阅读说明。 - CI lint
scripts/check_corpus_consumer_protocol.py强制执行九项协议不变量,并通过基于清单的消费者列表(scripts/corpus_consumer_manifest.json)进行管理。 - Schema 9 警告已移除:
shared/handoff_schemas.md移除了 v3.6.4 中“消费者侧集成推迟至 v3.6.5+”的警告;替换为指向消费者协议的反向指针。 - 基于存在性,无 schema 变更,无新环境标志。解析失败回退到仅外部数据库流程,并带有
[CORPUS PARSE FAILURE]提示。citation_compliance_agent的语料库集成已推迟(目标版本在 v3.8 之后待定)。 - 无破坏性变更。现有用户适配器无需修改即可工作。
v3.6.4 (2026-04-25) — 材料护照 literature_corpus[] 输入端口
literature_corpus[]字段 作为用户自有文献的可选输入端口添加到 Schema 9。每个条目符合shared/contracts/passport/literature_corpus_entry.schema.json(CSL-JSON 作者、年份、标题、source_pointer + 私有可选abstract/user_notes)。- 语言无关适配器契约 位于
academic-pipeline/references/adapters/overview.md:任何程序(任何语言)读取用户语料库源都可以生成符合规范的passport.yaml+rejection_log.yaml。条目级错误软失效,适配器级错误硬失效,确定性排序。 - 三个参考 Python 适配器 位于
scripts/adapters/:folder_scan.py(PDF 文件系统)、zotero.py(Better BibTeX JSON 导出)、obsidian.py(知识库 frontmatter)。仅为起点,用户应针对非参考源编写自己的适配器。 - 拒绝日志契约 位于
shared/contracts/passport/rejection_log.schema.json,带有封闭枚举的分类原因值;始终输出(无拒绝时为空)。 - CI 门禁:
scripts/check_literature_corpus_schema.py验证 schema + 适配器示例;scripts/sync_adapter_docs.py --check防止 schema→文档漂移;新的pytest.yml工作流在路径过滤触发时运行scripts/adapters/tests/。 - 仅输入端口(v3.6.4):v3.6.4 发布了 schema 和适配器契约,未进行消费者集成。
bibliography_agent和literature_strategist_agent已在 v3.6.5 中接入。 - 无破坏性变更。
v3.6.3 (2026-04-23) — 可选护照重置边界
- 可选护照重置边界(
ARS_PASSPORT_RESET=1)。将每个 FULL 检查点提升为上下文重置边界。新的resume_from_passport=<hash>模式允许用户仅凭材料护照账本在全新的 Claude Code 会话中恢复。开启标志时,systematic-review模式使重置在每个 FULL 检查点强制进行;其他模式将重置视为标志门控的默认行为。关闭标志时,保持与 v3.6.3 之前完全相同的逐字节行为。 - Schema 9 获得一个仅追加的
reset_boundary[]账本,包含两种条目类型(kind: boundary+kind: resume)。哈希使用 JSON 规范形式 + SHA-256,并使用规范占位符实现自引用安全。可选的pending_decision处理 MANDATORY 分支选择。 - 新的 CI lint:
scripts/check_passport_reset_contract.py每个提及标志的地方必须附带指向权威协议文档的指针。 - 协议文档:
academic-pipeline/references/passport_as_reset_boundary.md。 docs/PERFORMANCE.md已更新,加入长时运行会话指南。- 无破坏性变更。标志默认为 OFF。
v3.6.2 (2026-04-23) — 审稿人冲刺契约硬门禁
v3.6.2 引入了 Schema 13 冲刺契约和硬门禁编排,强制审稿人在阅读论文之前预先提交评分计划。仅为审稿人首个测试用例;撰写人/评估者推迟至 v3.6.4。详见 CHANGELOG。
- Schema 13 冲刺契约 包含
panel_size、acceptance_dimensions、failure_conditions(附带severity优先级 + 面板相对cross_reviewer_quantifier)、measurement_procedure、可选override_ladder、有界agent_amendments。验证器:scripts/check_sprint_contract.py。 - 两次调用硬门禁。 审稿人运行论文内容盲 Phase 1 + 论文可见 Phase 2;Phase 1 输出被包裹在
<phase1_output>...</phase1_output>数据定界符中,以缩小自注入攻击面。 - 合成器三步机械协议。 构建跨审稿人矩阵 → 使用面板相对量词和已识别表达词汇评估每个
failure_condition→ 按severity解决优先级。editorial_synthesizer_agent中明确列出了禁止操作列表。 - 两个审稿人模板已发布(
shared/contracts/reviewer/full.json面板 5;shared/contracts/reviewer/methodology_focus.json面板 2)。reviewer_re_review、reviewer_calibration、reviewer_guided在 schema 枚举中保留,但 v3.6.2 中未发布契约模板;它们保持 v3.6.2 之前的行为。reviewer_quick被完全排除在枚举之外。 academic-paper-reviewerSKILL 版本:1.8.1 → 1.9.0。academic-pipelineSKILL 版本:3.5.1 → 3.6.2(套件版本不变)。套件版本升至3.6.2。- 参见规范
docs/design/2026-04-23-ars-v3.6.2-sprint-contract-design.md和协议academic-paper-reviewer/references/sprint_contract_protocol.md。
v3.5.1 (2026-04-22) — 可选苏格拉底式阅读检查探针
v3.5.1 为苏格拉底导师添加了一个可选诚实性探针(ARS_SOCRATIC_READING_PROBE=1)。默认关闭。参见 CHANGELOG。
- 可选阅读检查探针:当设置
ARS_SOCRATIC_READING_PROBE=1时,苏格拉底导师会在用户引用了特定论文的目标导向会话中触发一次性诚实性探针。拒绝被记录,无惩罚。结果流入研究计划摘要和阶段6 AI 自省报告。无需新智能体,无模式变更。 deep-researchSKILL 版本:2.9.0 → 2.9.1。academic-pipelineSKILL 版本:3.5.0 → 3.5.1。套件版本升级至3.5.1。
v3.5.0 (2026-04-21) — 协作深度观察器
- 新智能体:
academic-pipeline中的collaboration_depth_agent(智能体团队从3个增至4个)。在每次 FULL/SLIM 检查点以及流水线完成时调用;根据4维评估标准对用户与AI的协作进行评分。仅作建议——绝不阻止进度。 强制检查点(阶段2.5/4.5完整性关卡)不调用观察器。 - 新评估标准:
shared/collaboration_depth_rubric.mdv1.0。维度:委托强度、认知警觉性、认知再分配、区域分类(区域1/区域2/区域3)。基于 Wang, S., & Zhang, H. (2026). “Pedagogical partnerships with generative AI in higher education: how dual cognitive pathways paradoxically enable transformative learning.” International Journal of Educational Technology in Higher Education, 23:11。DOI 10.1186/s41239-026-00585-x。 - 跨模型差异被标记而非平均:当设置
ARS_CROSS_MODEL时,观察器在两个模型上运行;维度分歧 > 2分时报告,而非静默平滑。ARS_CROSS_MODEL_SAMPLE_INTERVAL逃逸口用于成本权衡。 - 短阶段保护:用户轮次少于5次的阶段注入一个静态的
insufficient_evidence块,而非调度完整模型观察器。 - 反阿谀奉承规范:评分 ≥ 7需要特定的对话轮次引用;区域3触发重新审计;无激励性框架。
academic-pipelineSKILL 版本:3.3.0 → 3.4.0。套件版本升级至3.5.0。新增 lint 脚本scripts/check_collaboration_depth_rubric.py+ 10个测试。
v3.4.0 (2026-04-20) — 合规智能体 + 模式12
- 合规智能体(共享):单一模式感知智能体,运行 PRISMA-trAIce 17项(仅系统评价模式)+ RAISE 4原则 + 8角色矩阵。挂接到现有阶段2.5/4.5完整性关卡;基于等级阻塞(强制→阻塞,HR→警告,R/O→信息)。非系统评价条目仅运行原则,仅警告。
- 模式12 compliance_report通过
compliance_history[]追加到材料护照(仅追加)。 - 3轮用户覆盖阶梯自动在稿件中注入
disclosure_addendum。无法规避检测。 - 透明报告校准,无硬性 FNR/FPR 门控——与
task_type: open-ended自洽。 - 上游新鲜度CI对 PRISMA-trAIce 漂移发出警告(非阻塞)。
- 长时间运行会话文档:材料护照作为跨会话恢复机制。
v3.3.6 (2026-04-15) — README 精简 + ARCHITECTURE 文档
- 添加
docs/ARCHITECTURE.md,作为流水线结构(流程、矩阵、数据访问、依赖图、质量关卡、模式)的唯一真实来源。通过PR #18合并到主分支。 - 添加
docs/SETUP.md(前提条件、API密钥、Pandoc/tectonic、跨模型验证、安装方法)和docs/PERFORMANCE.md(token预算、推荐的 Claude Code 设置)。README 链接到两者而不是内联。 - 精简 README:移除了 ASCII 流水线图和16点关键特性列表(已被 ARCHITECTURE.md 取代);Skill Details 部分现在锚定版本号,并引导读者到 ARCHITECTURE.md §3 查看每个智能体的名册。
- 注意:任何技能均无功能变更。纯文档重组。套件版本升级至
3.3.6。
v3.3.5 (2026-04-15)
- 添加
benchmark_report.schema.json+ 材料护照上的可选repro_lock块。两者均附带模式文档、lint 和示例。首个正式 Python 开发依赖清单(requirements-dev.txt)。
v3.3.4 (2026-04-15) — README 更新日志同步补丁
- 同步了
README.md和README.zh-TW.md中的嵌入式更新日志章节,使其包含缺失的v3.3.3和v3.3.2版本摘要。 - 扩展了
scripts/check_spec_consistency.py,使未来 README 更新日志漂移会导致 CI 失败。
v3.3.3 (2026-04-15) — 发布准备 + Lint 强化
- 强化了 SKILL 前置 lint:缺失结束
---围栏现在明确失败,而不是被解析为有效 YAML。 - 解析为有效 YAML 但不是映射的前置现在报告可读错误,而不是崩溃。
- 修复了两个 README 中发布后审计报告展示链接的失效问题。
- 为规范一致性检查添加了 README 相对链接验证,使失效链接导致 CI 失败。
- 跨文档对齐了 DOCX 输出约定:直接生成
.docx依赖 Pandoc,Markdown + 转换说明作为备选。 - 准备
v3.3.3发布:套件版本升级,academic-paper-> v3.0.2,academic-pipeline-> v3.2.2。
v3.3.2 (2026-04-15) — 数据访问级别 + 任务类型元数据
- 为所有顶层
SKILL.md文件添加了metadata.data_access_level,强制使用词汇:raw、redacted、verified_only。 - 为所有顶层
SKILL.md文件添加了metadata.task_type,强制使用词汇:open-ended、outcome-gradable。 - 为两个元数据字段添加了 lint 脚本和单元测试,已接入 GitHub Actions 规范一致性工作流。
- 添加了
shared/ground_truth_isolation_pattern.md,并将新词汇链接到shared/handoff_schemas.md。
v3.3.1 (2026-04-14) — 规范一致性补丁
- 同步了 README、
.claude/CLAUDE.md、MODE_REGISTRY.md和SKILL.md文件,以匹配当前的模式数量和已发布的技能版本。 - 修正了跨模型措辞:完整性样本检查和独立 DA 评审已实现;第六审稿人同行评审仍为计划。
- 澄清了自适应检查点语义,使 SLIM 检查点仍等待明确的用户确认。
- 重申阶段2.5和阶段4.5完整性关卡不能跳过。
- 添加了一个轻量级规范一致性检查和 GitHub Actions 工作流,以捕获未来的漂移。
v3.3 (2026-04-09) — PaperOrchestra 启发的增强
集成了 PaperOrchestra 的技术(Song, Song, Pfister & Yoon, 2026, Google)。
- Semantic Scholar API 验证 — 通过 S2 API 进行第0层程序化参考文献存在性检查。标题 Levenshtein >= 0.70 匹配,DOI 不匹配检测,通过 S2 ID 进行参考文献去重。如果 API 不可用则优雅降级。
- 防泄漏协议 — 知识隔离指令将会话材料优先级高于 LLM 参数记忆。对于缺失内容标记
[MATERIAL GAP]而非从记忆中填充。降低模式5/6失败风险。 - VLM 图形验证(可选) — 使用视觉能力的 LLM 对渲染图形进行闭环验证。10项检查清单,最多2次优化迭代。
- 得分轨迹协议 — 每维度评估标准得分在修订轮次间的增量追踪(7个维度)。检测倒退(增量 < -3)并触发强制检查点。
- 阶段2并行化 — 可视化和论证构建可以在大纲完成后并行运行。
- 新版本:deep-research v2.8, academic-paper v3.0, academic-pipeline v3.2
v3.2 (2026-04-09) — Lu 2026 Nature Integration
整合了 Lu 等人(2026, Nature 651:914-919)的研究成果——首个通过盲审的端到端自主 AI 研究系统。
- 7-mode AI Research Failure Mode Checklist(7 模式 AI 研究失效模式检查清单)——在流水线的第 2.5/4.5 阶段,针对疑似实现错误、虚假结果、捷径依赖、将错误当作洞见、方法编造、框架锁定进行阻断。扩展了现有的 5 类引文幻觉分类体系。
- Reviewer Calibration Mode(审稿人校准模式,academic-paper-reviewer v1.8)——基于用户提供的黄金标准集,可选启用 FNR/FPR/balanced-accuracy 测量。采用 5 倍集成,默认跨模型启用,会话级置信度披露。
- Disclosure Mode(披露模式,academic-paper v2.9)——针对具体会议/期刊的 AI 使用声明生成器。v1 覆盖 ICLR、NeurIPS、Nature、Science、ACL、EMNLP。
- Early-Stopping Criterion(早停准则,academic-pipeline v3.1)——收敛性检查 + 流水线启动时的预算透明度。
- Fidelity-Originality Mode Spectrum(保真度-原创性模式谱)——根据 Lu 2026 图 1c,将全部模式按 3 个技能维度分类。
- 新版本:academic-paper v2.9、academic-paper-reviewer v1.8、academic-pipeline v3.1
v3.1.1 (2026-04-09) — IS Senior Scholars’ Basket of 11
外部贡献:@mchesbro1 最初提出并草拟了 IS Basket of 8 期刊(Issue #5);@cloudenochcsis 将其扩展为完整的 Senior Scholars’ Basket of 11(Issue #7、PR #8)。更新了 academic-paper-reviewer/references/top_journals_by_field.md 第 7 节,新增 Decision Support Systems、Information & Management 和 Information and Organization。来源:AIS Senior Scholars’ List of Premier Journals。
v3.1 (2026-04-06) — Anti-Context-Rot + Cognitive Frameworks + Lean Size
灵感来源于 aspi6246/Claude-Code-Skills-for-Academics 中的模式。
第一波:Anti-Context-Rot Anchors(抗上下文腐烂锚点)
- 全部 4 项技能中显式包含 29 个 Anti-Patterns(反模式)(每项技能 7-8 个,以表格格式呈现,包含“为何失败”+“正确行为”)
- 22 个 IRON RULE(铁律)标记,标识关键规则,即使在长对话中也不得违反
- academic-paper-reviewer 的只读约束(审稿人不得修改稿件)
第二波:Traceability + Cognitive Frameworks + Reinforcement(可追溯性 + 认知框架 + 强化)
- R&R Traceability Matrix(R&R 可追溯性矩阵,Schema 11):在重新审阅输出中增加“作者声称”和“已验证?”列,支持对修改声明的独立验证
- 3 个认知框架参考文件,教导智能体“如何思考”而不仅仅是“该做什么”:
argumentation_reasoning_framework.md— Toulmin 模型、Bradford Hill 因果推理、最佳解释推理、认知状态分类review_quality_thinking.md— 三个视角(内部效度、外部效度、贡献)、常见审稿人陷阱、校准问题writing_judgment_framework.md— 清晰性测试、读者旅程、学科特异风格、修订决策矩阵
- 对话中段强化协议:在每个流水线转换点重新提示阶段特定的 IRON RULE + Anti-Pattern 提醒
- 在每个 FULL checkpoint(完整检查点)设置自我检查问题(引文完整性、谄媚让步、质量轨迹、范围纪律、完整性)
第三波:Lean Skill Size(精简技能体积)
- SKILL.md 总大小从 142KB 缩减至 85KB(−40%),方法是将详细协议提取到
references/文件中 - 新增约 15 个参考文件(重审协议、引导模式、系统综述、流程摘要、外部审阅等)
- 所有 IRON RULE 标记保留在 SKILL.md 中;详细内容按需加载
- 新版本:deep-research v2.7、academic-paper v2.8、academic-paper-reviewer v1.7、academic-pipeline v3.0
v3.0 (2026-04-03) — Anti-Sycophancy + Intent Detection + Dialogue Health(反谄媚 + 意图检测 + 对话健康)
- Devil’s Advocate Concession Threshold(魔鬼代言人让步阈值,deep-research + academic-paper-reviewer):DA 必须在回应前对反驳进行 1-5 级评分。仅在 ≥4 分时让步。不允许连续让步。跟踪让步率。每个检查点后检测框架锁定。
- Attack Intensity Preservation(攻击强度保持,academic-paper-reviewer):DA 在遭到抵制时不会软化。通过明确的偏转检测协议进行反驳评估。反谄媚规则防止持续的抵制被视为有效证据。
- Intent Detection Layer(意图检测层,deep-research socratic):将用户意图分类为探索型 vs. 目标导向型。探索型模式下禁用自动收敛,提高最大轮次,禁止过早闭合。每 3 轮重新评估。
- Dialogue Health Indicator(对话健康指标,deep-research socratic):每 5 轮静默自检,检查是否存在持续同意、冲突回避、过早收敛。当检测到同意模式时自动注入挑战。
- Cross-Model Verification Protocol(跨模型验证协议,共享,可选):使用 GPT-5.4 Pro 或 Gemini 3.1 Pro 进行完整性验证的样本交叉检查以及独立的 DA 评审。第六审稿人同行评审仍处于计划阶段,尚未实现。通过设置
ARS_CROSS_MODEL环境变量激活——不设置则一切照常工作。完整设置指南、API 模式和成本估算参见shared/cross_model_verification.md。 - AI Self-Reflection Report(AI 自我反思报告,academic-pipeline Stage 6):流水线后对 AI 行为模式的自我评估——DA 让步率、检查点跳过率、健康警报、谄媚风险评级(LOW/MEDIUM/HIGH)、框架锁定事件、收敛模式分析。包含讽刺性免责声明:“此自我反思本身由可能导致谄媚的同一 AI 生成。”
- 起源:通过一个 4 轮辩证实验发现,在该实验中 DA 让步过快,苏格拉底导师试图过早收敛,整个辩论始终锁定在人类设定的框架中。
- 版本:deep-research v2.5、academic-paper-reviewer v1.5、academic-pipeline v2.8
v2.9.1 (2026-04-03) — Skill Metadata(技能元数据)
- 在所有 4 个 SKILL.md 的 frontmatter 中添加了
status: active和related_skills交叉引用。 - 支持技能发现工具以及跨技能导航,覆盖
deep-research↔academic-paper↔academic-paper-reviewer↔academic-pipeline。
v2.9 (2026-03-27) — Style Calibration + Writing Quality Check(风格校准 + 写作质量检查)
- Style Calibration(风格校准,academic-paper 输入阶段第 10 步,可选):提供 3 篇以上过往论文,流水线将学习你的写作风格——句子节奏、词汇偏好、引文整合方式。在起草过程中作为软性指导;学科惯例始终优先。优先级系统:学科规范(硬)> 期刊惯例(强)> 个人风格(软)。参见
shared/style_calibration_protocol.md - Writing Quality Check(写作质量检查,
academic-paper/references/writing_quality_check.md):在草稿自我审阅时应用的写作质量检查清单。5 个类别:AI 高频词警告(25 个词)、标点模式控制(em dash ≤3)、开场废话检测、结构模式警告(三原则、均匀段落、同义词循环)、突发性检查(句子长度变化)。这些都是良好的写作规则——而非检测规避手段 - Style Profile(风格档案)通过 academic-pipeline 的 Material Passport(材料护照,shared/handoff_schemas.md 中的 Schema 10)传递
- deep-research 的报告编译器也可选使用这两项功能
- 版本:academic-paper v2.5、deep-research v2.4、academic-pipeline v2.7
v2.8 (2026-03-22) — SCR Loop Phase 1: 状态-质疑-反思
- Socratic 导师代理 (deep-research + academic-paper):集成 SCR (状态-质疑-反思) 协议
- 承诺门 (Commitment Gates):在每个层级/章节过渡时,在呈现证据前收集用户的预测
- 确定性触发的矛盾 (Certainty-Triggered Contradiction):检测高置信度语言(如“显然”、“明显”)并引入反驳观点
- 自适应强度 (Adaptive Intensity):跟踪承诺准确性,动态调整质疑频率
- 自校准信号 (S5):新的收敛信号,跟踪用户在对话中的自校准成长
- SCR 开关:用户可以说“跳过预测”以禁用,或说“重新打开预测”以在对话中重新启用;苏格拉底式提问正常进行
deep-research/references/socratic_questioning_framework.md:SCR 覆盖协议,将 SCR 阶段映射到苏格拉底功能- 新增
CHANGELOG.md
v2.7 (2026-03-09) — 完整性验证 v2.0:反幻觉大修
- integrity_verification_agent v2.0:反幻觉指令(无 AI 内存验证),消除灰色地带分类(仅保留 VERIFIED/NOT_FOUND/MISMATCH),每个引用强制进行 WebSearch 审计跟踪,第 4.5 阶段全新独立验证,灰色地带预防规则
- 已知幻觉模式:基于 GPTZero × NeurIPS 2025 研究的 5 类分类法 (TF/PAC/IH/PH/SH)、5 种复合欺骗模式、真实案例研究、文献统计数据
- 发表后审计:对所有 68 个引用进行的完整 WebSearch 验证发现了 21 个问题(31% 的错误率),这些问题通过了 3 轮完整性检查——证明了外部验证的必要性
- 论文更正:删除了 4 个捏造的引用,修复了 6 个作者错误,更正了 7 个元数据错误,修复了 2 个格式问题
v2.6.2 (2026-03-09) — 基于意图的模式激活
- deep-research:Socratic 模式现在使用基于意图的激活,而非关键词匹配。支持任何语言——检测含义(例如“用户希望得到引导性思考”),而不是匹配特定字符串。
- academic-paper:Plan 模式现在使用基于意图的激活。检测任何语言中的意图信号,例如“用户不确定如何开始”或“用户需要逐步指导”。
- 两种模式现在都有一个默认规则:当意图不明确时,优先选择
socratic/plan而非full——先引导更安全。 - 双层架构:第一层(技能激活)使用双语关键词进行匹配置信度;第二层(模式路由)使用语言无关的意图信号。
v2.6.1 (2026-03-09) — 双语触发关键词
- deep-research:为通用激活和 Socratic 模式添加了繁体中文触发关键词。
- academic-paper:添加了繁体中文触发关键词和 Plan 模式触发部分。
- 两个模式选择指南现在都包含双语示例和特定于中文的错误选择场景。
v2.6 / v2.4 / v1.4 (2026-03-08) — 15+ 项改进
- deep-research v2.3:新增系统综述 / PRISMA 模式(第 7 种);3 个新代理(risk_of_bias、meta_analysis、monitoring);PRISMA 协议/报告模板;苏格拉底收敛标准(4 个信号 + 自动结束);快速模式选择指南
- academic-paper v2.4:2 个新代理(visualization、revision_coach);带有 4 种状态类型的修订跟踪模板;引文格式转换(APA↔Chicago↔MLA↔IEEE↔Vancouver);统计可视化标准;苏格拉底收敛标准;修订恢复示例;LaTeX 输出强化 — 强制使用
apa7文档类,文本对齐修复(ragged2e+etoolbox),表格列宽公式,双语摘要居中,标准化字体栈(Times New Roman + Source Han Serif TC VF + Courier New),仅使用 tectonic 生成 PDF - academic-paper-reviewer v1.4:质量评分标准,0-100 分制并带有行为指标;决策映射(≥80 接受,65-79 小修,50-64 大修,<50 拒稿);快速模式选择指南
- academic-pipeline v2.6:自适应检查点系统(FULL/SLIM/MANDATORY);完整性检查中的 E 阶段声明验证;用于中途溯源的材料护照;跨技能模式顾问(14 种场景);团队协作协议;增强的交接模式(9 种模式);完整性故障恢复示例
v2.4 / v1.3 (2026-03-08)
- academic-pipeline v2.4:新增第 6 阶段 PROCESS SUMMARY — 自动生成结构化的论文创建过程记录(MD → LaTeX → PDF,双语);强制性的最终章节:协作质量评估,包含 6 个维度的 1–100 分评分(方向设定、智力贡献、质量把关、迭代纪律、委派效率、元学习),诚实反馈和改进建议;流水线从 9 个阶段扩展为 10 个阶段
v2.3 / v1.3 (2026-03-08)
- academic-pipeline v2.3:第 5 阶段 FINALIZE 现在提示选择格式样式(APA 7.0 / Chicago / IEEE);PDF 必须通过
tectonic从 LaTeX 编译(不允许 HTML 转 PDF);APA 7.0 使用apa7文档类(man模式)并配合 XeCJK 实现双语 CJK 支持;字体栈:Times New Roman + Source Han Serif TC VF + Courier New
v2.2 / v1.3 (2025-03-05)
- 跨代理质量对齐:所有代理中统一了定义(同行评审、时效性规则、CRITICAL 严重性、来源层级)
- deep-research v2.2:综合反模式、苏格拉底自动结束条件、DOI+WebSearch 验证、增强的伦理完整性检查、模式转换矩阵
- academic-paper v2.2:4 级论证评分、剽窃筛查、2 条新的失败路径(F11 desk-reject 恢复、F12 会议转期刊)、Plan→Full 模式转换
- academic-paper-reviewer v1.3:DA 与 R3 角色边界、CRITICAL 发现标准、共识分类(4/3/SPLIT/DA-CRITICAL)、置信度加权、亚洲与区域期刊参考
- academic-pipeline v2.2:检查点确认语义、模式切换矩阵、失败回退矩阵、状态所有权协议、材料版本控制
v2.0.1 (2026-03)
- 简化 4 个 SKILL.md(-371 行,-16.5%):删除跨技能重复内容,内联模板 → 文件引用,冗余路由表,重复的模式选择部分
- 修复 academic-paper 与 academic-pipeline 之间修订循环上限的矛盾
v2.0 (2026-02)
- academic-pipeline v2.0:5→9 个阶段,强制完整性验证,两阶段审查,苏格拉底修订指导,可重现性保证
- academic-paper-reviewer v1.1:+魔鬼代言人审稿人(第 7 个代理),+重新审查模式(验证),+审查后的苏格拉底指导
- 新代理:
integrity_verification_agent— 100% 引用/数据验证,附带审计跟踪 - 新代理:
devils_advocate_reviewer_agent— 8 维度论文挑战者 - 输出顺序:MD → 可用时通过 Pandoc 转换为 DOCX(否则提供说明)→ 询问 LaTeX → 确认 → PDF
v1.0 (2026-02)
- 初始发布
- deep-research v2.0(10 个代理,6 种模式,包括 socratic)
- academic-paper v2.0(10 个代理,8 种模式,包括 plan)
- academic-paper-reviewer v1.0(6 个代理,4 种模式,包括 guided)
- academic-pipeline v1.0(编排器)
