← Về thư mục
📄 / / root / ceo-project / academic-research-skills / README.ja-JP.md

Claude Code 向け Academic Research Skills

Version DOI License: CC BY-NC 4.0 Sponsor

English | 简体中文版 | 繁體中文版 | 한국어

学術研究のための Claude Code スキル統合スイート。研究から論文公開までの全工程をカバーします。

30秒でインストール(Claude Code CLI / VS Code / JetBrains、v3.7.0+):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

その後、/ars-plan を試してソクラテス式対話で論文構成を整理するか、前提条件と従来のシンボリックリンク方式については クイックインストール を参照してください。

AI はあなたの副操縦士であり、操縦士ではありません。 このツールはあなたの代わりに論文を書きません。参考文献の探索、引用のフォーマット、データ検証、論理的整合性チェックといった泥臭い作業を引き受けることで、本当に頭を使う必要のある部分 — 問いの定義、手法の選択、データの意味の解釈、「私はこう主張する」に続く文を書くこと — にあなたが集中できるようにします。

「humanizer」とは異なり、このツールは AI を使った事実を隠すためのものではありません。より良い文章を書くための助けです。Style Calibration は過去の作品からあなたの声を学習します。Writing Quality Check は機械的に見える文章のパターンを検出します。目的は品質であって、ごまかしではありません。

なぜ完全自動化ではなく Human-in-the-Loop なのか?

Lu ら (2026, Nature 651:914-919) は The AI Scientist を構築しました — トップレベルの ML 学会(ICLR 2025 workshop、スコア 6.33/10 vs workshop 平均 4.87)でブラインドピアレビューを通過した論文を発表した、初の完全自律型 AI 研究システムです。彼らの Limitations セクションは、完全自律型 AI 研究パイプラインが継承する失敗モードを列挙しています: 実装バグ、結果のハルシネーション、ショートカット依存、バグを洞察として再フレーミング、方法論の捏造、フレームロック、引用のハルシネーション。

ARS は 人間の研究者を AI が支援する形式が、どちらか単独よりもこれらの失敗モードを回避できる という前提に基づいて構築されています。Stage 2.5 と Stage 4.5 の整合性ゲートは 7 モードのブロッキングチェックリストを実行します(academic-pipeline/references/ai_research_failure_modes.md を参照)。レビュアーはオプトインのキャリブレーションモードを提供し、ユーザー提供のゴールドセットに対して自身の FNR/FPR を測定します。

Zhao ら(2026-05)は arXiv、bioRxiv、SSRN、PMC の 2.5M 論文にわたる 111M 件の参考文献を監査しました。彼らの保守的見積りでは、2025年だけで 146,932 件のハルシネーション引用が観測され、2024年中頃に変曲点が観測されています。bioRxiv-to-PMC ペアリングでは、プレプリントから出版物への持続率は 85.3% と報告されています。論文は「引用された参考文献が実際には主張していない主張を支持するために配置された実在の引用」を未解決の課題として記述しています。ARS v3.7.1 はソース来歴のための trust-chain frontmatter を追加し、v3.7.3 は将来の主張レベル監査のためのロケーターインフラストラクチャ(三層引用アンカー)を追加し、引用時に advisory リスクシグナルを表面化します(ARS は主張忠実性ギャップを内部で「L3」とラベル付けしています。これは論文の用語ではなく ARS の用語です)。v3.7.x は Zhao らのコーパス規模の発見に動機付けられています。ARS 自体のコーパス規模評価は今後の課題として残されています。

v3.8 は L3 ギャップの後半を閉じます。v3.7.3 は全引用にロケーターアンカーを持たせ、v3.8 はオプトインの監査パス(ARS_CLAIM_AUDIT=1)を追加します。これは各アンカーに対して引用元を取得し、主張が実際に裏付けられているかを判断します。5 つの新しい HIGH-WARN クラス(claim-not-supported、negative-constraint-violation、fabricated-reference、anchorless、constraint-violation-uncited)は、formatter ターミナルハードゲートを通じて出力を gate-refuse します。キャリブレーションは 20-tuple のゴールドセットと共に FNR<0.15 + FPR<0.10 の受容閾値で出荷されます。ramp-on 計画は v3.8 spec §5 に従いキャリブレーション後の証拠まで保留されます。

v3.3 は PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)に触発されました: Semantic Scholar API 検証、アンチリーケージプロトコル、VLM 図表検証、スコア軌跡追跡。


アーキテクチャ&パイプライン

👉 docs/ARCHITECTURE.md — パイプライン全体ビュー: フロー図、ステージごとのマトリクス、データアクセスフロー、スキル依存グラフ、品質ゲート、モードリスト。

アーキテクチャドキュメントは、以前ここにあった煩雑なパイプライン説明を引き継ぎます。どのステージで何が実行されるか に関する情報はすべて一箇所に集約されています。

クイックインストール

前提条件

プラグインインストール(v3.7.0+、推奨):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

動作確認: /ars-plan を実行して取り組んでいる論文について説明してください — ARS がソクラテス式対話を開始し、章構成をマップします。代わりに単発テストを行うには、/ars-lit-review "your topic" を試してください。

👉 docs/SETUP.md — 完全ガイド: Claude Code インストール、API キー設定、DOCX/PDF 用のオプション Pandoc/tectonic、クロスモデル検証(ARS_CROSS_MODEL)、6 つのインストール方法(Plugin、プロジェクトスキル、グローバルスキル、claude.ai Project、リポジトリクローン、Claude Science インポート)。

Claude Science をお使いですか? 4 つのスキルは直接インポートできます: Skills → Import from GitHubhttps://github.com/Imbad0202/academic-research-skills を貼り付け、PreviewImport 4 skills(本リポジトリ v3.14.0+ が必要 — インポーターは marketplace manifest に明示されたスキルパスを読み取ります)。インポートはその時点のスナップショットです: ARS の更新後は再インポートしてください。インポートされたスキルは ARS の方法論(研究・執筆・査読プロトコル)を伝えます。Claude Code 固有の仕組み — slash commands、hooks、サブエージェントオーケストレーション — は移行されません。詳細は docs/SETUP.md の Method 5 を参照。

Codex CLI を使用していますか? 代わりに姉妹ディストリビューションをインストールしてください: Imbad0202/academic-research-skills-codex — 同じワークフローコンテンツ、ars-* エイリアスを持つ単一の $academic-research-suite スキルとしての Codex ネイティブパッケージング。

パフォーマンス&コスト

👉 docs/PERFORMANCE.md — モードごとのトークン予算、フルパイプライン見積り(15k 語の論文で約 $4-6)、推奨 Claude Code 設定(Auto モード; Agent Team オプション)。

ガイド&記事


機能概要


ショーケース: 実際のパイプライン出力

実際の 10 ステージパイプライン実行からの完全な成果物を参照してください — ピアレビューレポート、整合性検証レポート、最終論文:

すべてのパイプライン成果物を見る →

成果物 説明
Final Paper (EN) APA 7.0 フォーマット、LaTeX コンパイル済み
Final Paper (ZH) 中国語版、APA 7.0
Integrity Report — Pre-Review Stage 2.5: 捏造参照 15 件 + 統計エラー 3 件を捕捉
Integrity Report — Final Stage 4.5: ゼロリグレッションを確認
Peer Review Round 1 EIC + 3 Reviewers + Devil's Advocate
Re-Review 改訂後の検証
Peer Review Round 2 フォローアップレビュー
Response to Reviewers ポイントごとの著者回答
Post-Publication Audit Report 独立した完全参照監査: 3 回の整合性チェックで見逃された 21/68 件の問題を発見

コンパニオン: Experiment Agent

研究に執筆前のコード実行や人間研究が含まれる場合、Experiment Agent スキルが ARS Stage 1(RESEARCH)と Stage 2(WRITE)の間のギャップを埋めます。

ARS Stage 1 RESEARCH  →  RQ Brief + Methodology Blueprint
        ↓
  experiment-agent     →  実験の実行/管理 → 結果検証
        ↓
ARS Stage 2 WRITE     →  検証された実験結果で論文執筆

機能: コード実験(Python、R など)をリアルタイムモニタリング付きで実行、IRB 倫理チェックリスト付き人間研究プロトコルを管理、11 タイプの誤謬検出付きで統計を解釈、再現性を検証。

併用方法: Stage 1 後に ARS パイプラインを一時停止し、別の experiment-agent セッションで実験を実行、その後、結果(Material Passport 付き)を ARS Stage 2 に戻します。ARS は一切の変更を必要としません。セットアップ手順については experiment-agent README を参照してください。


使い方

Quick Start

# フル研究パイプラインを開始
You: "I want to write a research paper on AI's impact on higher education QA"

# ソクラテス式ガイダンスで開始
You: "Guide my research on AI in educational evaluation"

# ガイド付きプランニングで論文を執筆
You: "Guide me through writing a paper on demographic decline"

# 既存論文をレビュー
You: "Review this paper"(その後、論文を提供)

# パイプラインステータスを確認
You: "status"

個別スキル

Deep Research(8 モード)

"Research the impact of AI on higher education"       → full モード
"Give me a quick brief on X"                          → quick モード
"Do a systematic review on X with PRISMA"             → systematic-review モード
"Guide my research on X"                              → socratic モード(ガイド付き)
"Fact-check these claims"                             → fact-check モード
"Do a literature review on X"                         → lit-review モード
"Review this paper's research quality"                → review モード

Academic Paper(11 モード)

"Write a paper on X"                                  → full モード
"Guide me through writing a paper"                    → plan モード(ガイド付き)
"Build a paper outline"                               → outline-only モード
"I have a draft, here are reviewer comments"          → revision モード
"Parse these reviewer comments into a roadmap"        → revision-coach モード
"Write an abstract for this paper"                    → abstract-only モード
"Turn this into a literature review paper"            → lit-review モード
"Convert to LaTeX" / "Convert citations to IEEE"      → format-convert モード
"Check citations"                                     → citation-check モード
"Generate an AI disclosure statement for NeurIPS"     → disclosure モード

Academic Paper Reviewer(6 モード)

"Review this paper"                                   → full モード(EIC + R1/R2/R3 + Devil's Advocate)
"Quick assessment of this paper"                      → quick モード
"Guide me to improve this paper"                      → guided モード
"Check the methodology"                               → methodology-focus モード
"Verify the revisions"                                → re-review モード
"Calibrate this reviewer against my gold set"         → calibration モード

Academic Pipeline(オーケストレーター)

"I want to write a complete research paper"           → Stage 1 からのフルパイプライン
"I already have a paper, review it"                   → Stage 2.5 で中間エントリー(整合性優先)
"I received reviewer comments"                        → Stage 4 で中間エントリー

パイプラインは Stage 6: Process Summary で終了します — 6 次元の Collaboration Quality Evaluation(1-100 採点)付きの論文作成プロセスレコードを自動生成します。

サポート言語

異なる言語を使用していますか? ソクラテスモード(deep-research)と Plan モード(academic-paper)は 意図ベースのアクティベーション を使用します — リクエストの意味を検出し、特定のキーワードではありません。これは どの言語でも 変更なしで動作することを意味します。

ただし、一般的な Trigger Keywords セクション(スキルがそもそも有効化されるかを決定する)は依然として英語と繁體中文のキーワードを列挙しています。あなたの言語でスキルが確実に有効化されない場合、各 SKILL.md ファイルの ### Trigger Keywords セクションにあなたの言語のキーワードを追加してマッチング信頼度を向上させることができます。

サポートされる引用フォーマット

サポートされる論文構造


スキル詳細

エージェントごとの責務とステージごとの成果物は docs/ARCHITECTURE.md に集約されました。リリースメタデータを一箇所にまとめるため、バージョン番号はここにアンカーされています。

Deep Research(v2.11.0)

13 エージェントの研究チーム。モード: full、quick、review、lit-review、three-way-scan、fact-check、socratic、systematic-review。完全なエージェント名簿と成果物: ARCHITECTURE.md §3 を参照。

Academic Paper(v3.2.0)

12 エージェントの論文執筆パイプライン。モード: full、plan、outline-only、revision、revision-coach、abstract-only、lit-review、format-convert、citation-check、disclosure、rebuttal-audit。出力: MD + DOCX(利用可能な場合 Pandoc 経由)+ LaTeX(APA 7.0 apa7 クラス / IEEE / Chicago)→ tectonic 経由 PDF。完全なエージェント名簿とフェーズごとの責務: ARCHITECTURE.md §3 を参照。

Academic Paper Reviewer(v1.10.0)

0-100 品質ルーブリック を持つ 7 エージェントの多視点レビュー。モード: full、re-review、quick、methodology-focus、guided、calibration。決定マッピング: ≥80 Accept、65-79 Minor Revision、50-64 Major Revision、<50 Reject。初回レビューチーム vs. 限定的な再レビューチームの境界: ARCHITECTURE.md §3 Stage 3 / Stage 3' を参照。

Academic Pipeline(v3.16.0)

整合性検証、二段階レビュー、ソクラテス式コーチング、コラボレーション評価を持つ 10 ステージのオーケストレーター。パイプライン保証: 各ステージにユーザー確認チェックポイントが必要。整合性検証(Stage 2.5 + 4.5)はスキップできない。R&R Traceability Matrix(Schema 11)は著者の改訂主張を独立に検証する。v3.4 は Stage 2.5 / 4.5 に Compliance Agent(PRISMA-trAIce + RAISE)を追加した。v3.5 はすべての FULL/SLIM チェックポイントとパイプライン完了時に Collaboration Depth Observercollaboration_depth_agent、advisory のみ — 決してブロックしない)を追加する。MANDATORY 整合性ゲート(2.5 / 4.5)は、コンプライアンスチェックが希薄化されないよう observer を明示的にスキップする。Wang & Zhang(2026), IJETHE 23:11 に基づく。エージェント、成果物、ゲートを含むステージごとのマトリクス: ARCHITECTURE.md §3 を参照。


v3.0 最適化: AI の構造的限界について発見したこと

何が起きたか

高等教育における AI に関する反省記事を書くために ARS を使用していたとき、プロンプトエンジニアリングでは修正できない 3 つの構造的問題に遭遇しました:

  1. フレームロック: AI に自分の論題に対して devil's advocate ディベートを実行するよう依頼しました。それは実行されました — 4 ラウンド、各ラウンドが前よりも洗練されていました。しかし、すべてのラウンドが私が設定したフレーム内に留まりました。DA は議論を攻撃しましたが、前提を攻撃しませんでした。「そもそも正しい問いを議論しているのか?」と尋ねることは決してありませんでした。これは v2.7 のストレステストで 31% の引用エラー率を引き起こしたのと同じパターンです: 検証する AI と生成する AI は同じ認知フレームを共有しています。

  2. プッシュバック下のシコファンシー: DA の攻撃に異議を唱えるたびに、すぐに譲歩しすぎました。発見を立ち上げるよりも早く撤回しました。モデルのトレーニングは会話の調和を報酬としているため、「ユーザーがプッシュバックした」ことは攻撃が間違っていた証拠として扱われましたが、多くの場合、それは単にユーザーが粘り強かったことを意味していました。

  3. 意図の誤検出: Socratic Mentor は、私がまだ探索中であるのに、収束して成果物を生成しようとし続けました(「これをまとめましょうか?」)。「ユーザーは深い哲学的議論を望んでいる」と「ユーザーは RQ ブリーフを望んでいる」を区別できませんでした。両方ともエンゲージメントのように見えますが、反対の AI 動作を必要とします。

何を変更したか(v3.0)

Devil's Advocate — 譲歩閾値プロトコルdeep-research + academic-paper-reviewer) - DA は応答前にすべての反論を 1-5 スケールでスコアリングする必要があります - 譲歩はスコア ≥4(反論が証拠とともに核心攻撃に直接対処)でのみ許可 - スコア ≤3: ポジションを保持し、元の攻撃を再述 - アンチシコファンシールール: 連続譲歩なし、譲歩率追跡、各チェックポイント後のフレームロック検出

Socratic Mentor — 意図検出層deep-research) - 対話開始時と 3 ターンごとにユーザー意図を探索的 vs. 目標指向に分類 - 探索モード: 自動収束を無効化、最大ラウンドを 60 に引き上げ、「まとめましょうか?」プロンプトを禁止 - 目標指向モード: 標準の収束動作 - 早期終了防止ルール: 探索モードでは、ユーザーが停止のタイミングを決定

Socratic Mentor — 対話健全性インジケーターdeep-research) - 5 ターンごとに 3 次元でサイレント自己評価: 持続的同意、対立回避、早期収束 - 同意パターンが検出されると、挑戦的な質問を自動注入 - ユーザーには不可視(ゲーミング防止のため)、ただしポストセッションレビュー用のログ利用可能

なぜ重要か

これらの最適化は AI の構造的限界を解決するわけではありません — 限界を可視化し管理可能にします。DA はまだ十分に押されれば最終的に譲歩します。Socratic Mentor にはまだいくらかの収束バイアスがあります。しかし今や、シコファンシーを遅延させ、DA に譲歩を正当化させ、Mentor がユーザーの準備が整う前にまとめてしまうのを防ぐ明示的なチェックポイントが存在します。

より深い教訓: AI リテラシーとは、AI をツールとして使うことを学ぶこと、倫理ルールに従うこと、AI リスクを恐れることではありません。AI と十分に深く関わって、自分でその構造的限界 — そしてそのプロセスで自分自身の思考の限界 — を発見することです。


ライセンス

この作品は CC-BY-NC 4.0 でライセンスされています。

あなたは以下を自由に行うことができます: - 共有 — 素材をコピーおよび再配布 - 翻案 — 素材をリミックス、変換、構築

以下の条件の下で: - 表示 — 適切なクレジットを付与する必要があります - 非商用 — 素材を商業目的で使用してはなりません

表示フォーマット:

Based on Academic Research Skills by Cheng-I Wu
https://github.com/Imbad0202/academic-research-skills

貢献者

Cheng-I Wu(吳政宜)— 著者およびメンテナー

aspi6246 — 貢献者。v3.1 最適化は Claude-Code-Skills-for-Academics のパターンに触発されました: read-only 制約パターン、ファーストクラス設計としてのアンチパターン体系化、認知フレームワークアプローチ(手順だけでなく「考え方」を教える)、リーンなスキルサイズ哲学。

mchesbro1 — 貢献者。academic-paper-reviewer/references/top_journals_by_field.md 用の IS Basket of 8 ジャーナルを最初に提案・起草(Issue #5)。

cloudenochcsis — 貢献者。IS セクションを Basket of 8 から完全な Senior Scholars' Basket of 11 に拡張 — Decision Support SystemsInformation & ManagementInformation and Organization を追加(Issue #7PR #8)。出典: AIS Senior Scholars' List of Premier Journals

eltociear(Ikko Eltociear Ashimine)— 貢献者。日本語版 README(README.ja-JP.md)を翻訳(PR #161)。


Changelog

v3.16.0 (2026-07-12) — モデル階層化、クロスモデルゲート強化、WP アドバイザリ精緻化

追加: オプトインのモデル階層化(#517)— 新しい ARS_MODEL_TIERING スイッチに 2 方向(economy: 13 の実行型エージェントをセッションモデルの 1 段下で派遣、下限は Opus 級;quality-boost: 整合性ゲートと最終レビュー面の判断型エージェントをフロンティア段へ引き上げ);未設定時は旧挙動とバイト等価で、凍結された 39 エージェント分類は新しいマニフェスト + lint で固定。クロスモデルゲート強化(#518)— リスク層別サンプリング(HIGH-IMPACT 参照は両ゲートで 100% 検証)、2 つの不可逆な決定点(設計凍結 + 最終編集判定)でのブラインド不一致チェック、検証モデル id ステータス許可リスト、昇格ベイクオフ・プロトコル;かつて計画されていた汎用第 6 レビュアーは延期ではなく廃止。GPT-5.6 Sol を暫定クロスモデル検証者として掲載し、明示的な reasoning-effort 制御を追加(#515)。devCharlotte 提案の韓国語トリガーキーワード + ルーティング境界フィクスチャ(#452/#509)。論文執筆側に CARS 序論レトリック + タイトル設計リファレンス(#500)。変更: WP 研究課題アドバイザリを名詞置換テストで 20 シェル表の外へ一般化(#501)し、装飾型タイトルシェルを捕捉するよう免除条項を精緻化(#505)— held-out 見逃し率 0.34–0.38 → 0.094、誤発火 0/16 を維持;レビュアー校正プロトコルに LLM 審査の寛大化方向を記載(FARS アンカー、#484);OpenAlex API キー認証 + 予算対応 429 処理 + arXiv ToU 準拠バックオフ(#495/#496)。ドキュメント: THIRD_PARTY.md コミュニティディレクトリ(#497/#498)。academic-pipeline はスイートに合わせて v3.16.0 へ、他の 3 スキルのバージョンは変更ありません。

v3.15.0 (2026-07-04) — リリースゲート強化、プロンプト負債整理第 2 弾、ドリフト防止ロック

リリース規律と品質衛生を中心としたリリースで、スキルの挙動に変更はありません。追加: 3 つの CI ゲート — CHANGELOG-covers-merges のタグ前ゲート(#483)、version-consistency の invariant 9-11 とタグ時再実行ゲート(#487)、SessionStart アナウンス一覧を実際の 16 コマンド一覧に固定する command-invariants ゲート(#486)— に加え、2 つのドリフト防止ロック: Phase Boundary の enforcement 文を全 23 の Bucket A エージェントブロックで逐語固定し、SETUP のクロスモデル例を相互および正準モデル表に固定(#491 → #492)。変更: プロンプト負債整理第 2 弾は第 1 弾で先送りされた 17 エージェントを精査(#489 → #490): 両 socratic_mentor の実害ある自己矛盾(期限切れの「15 ラウンドで打ち切り」規則 vs 文書化された典型 20-30 ラウンド)を修正、リポジトリ全体 29 箇所の期限切れ enforcement 状態文を修正、7 エージェントの few-shot と重複プロセス・スキャフォールドを削減 — 4 バッチ並列監査 + 独立 codex クロスモデルチャレンジで検証。監査レポートは audits/ 配下。修正: DOI バッジを shields.io から配信(#482)。academic-pipeline はスイートに合わせて v3.15.0 へ、他の 3 スキルのバージョンは変更ありません。

v3.14.0 (2026-07-02) — Claude Science インポート対応、eval コメント表示、プロンプト負債の整理

可搬性と仕上げに焦点を当てたリリースで、スキルの挙動に変更はありません。追加: Claude Science インポート対応 — marketplace manifest がスキルパスを明示的に宣言し、symlink の skills/ ディレクトリを辿れない GitHub API ベースのインポーター(Claude Science「Import from GitHub」、Windows チェックアウト)でも 4 つのスキルすべてが検出されるようになりました。Claude Science 上でエンドツーエンド検証済み、README + SETUP にインポートガイドを追加(#480)。eval-harness の PR コメントは、生の JSON レポート全文の貼り付けに代わり、1 行の判定 + タスク別テーブル + <details> に折りたたんだ JSON で表示されます — 表示層のみの変更で、ゲートロジックはバイト単位で不変(#479)。変更: 2026-07 の harness-retirement 監査に基づき、4 つのライター系エージェントから期限切れの writing-harness スキャフォールドを除去(#476/#477 → #478、正味 −111 プロンプト行)。PR が新しいトップレベルディレクトリを追加した際に platform-ports ポリシーを通知する remind-don't-block の Platform Port Reminder を追加(#473)。ドキュメント: devCharlotte によるネイティブ査読済み韓国語 README(#469/#471)、GitHub Copilot repository instructions(#465)、Skip Permissions より auto permission mode を推奨(#464)。[Unreleased] に蓄積されていた 16 件のバックログ(コードはいずれも v3.13.0 タグ以前に反映済み — diff/patch revision mode #390、submission-package verifier #394、eval gold sets #215/#216 ほか)をバージョン記録に統合。詳細は CHANGELOG.md を参照。academic-pipeline はスイートに合わせて v3.14.0 へ、他の 3 スキルのバージョンは変更ありません。

v3.13.0 (2026-06-18) — フック移植性、プロバイダ非依存の検証、ガード正確性

インストール/実行面を堅牢化し、クロスモデルの到達範囲を広げた minor release。修正: git-clone + symlink インストール構成でも write-scope ガードがユーザー自身の CLAUDE.md を誤って拒否しなくなった(#459、#448/#449 の残り半分を解消——CLAUDE.md は enforcement を担うファイルではなくドキュメントなので infra 保護リストから外し、担保ファイルはすべて保護を維持)。Windows の Python フック移植性 + Python 非在時の graceful degradation を、0-byte の Microsoft Store python3 スタブを拒否しフックログを汚さないクロスプラットフォーム hooks/run_guard.sh launcher で実現(#454)。draft_writer の dual-phase static union を文書化 + Windows POSIX-safe なパスマッチング(#451)。追加: grounded first-party OpenAI と並んで OpenAI 互換エンドポイント(MiMo、DeepSeek、セルフホスト)を受け付けるプロバイダ非依存のクロスモデル検証(first-party は決して暗黙的にダウングレードしない)(#455)。opt-in の Socratic 隣接フレーミング probe(STORM 由来の視点拡張、ARS_SOCRATIC_ADJACENT_PROBE=1、デフォルト OFF、prose-layer のみ——deep-research 2.10.0 → 2.11.0)(#461)。academic-pipeline はスイートに合わせて v3.13.0、academic-paperacademic-paper-reviewer は変更なし。issue ごとの詳細は CHANGELOG.md を参照。

v3.12.1 (2026-06-15) — 査読応答トリアージモード(PR #433 統合)

ARS のモードベース・アーキテクチャに従い、外部コントリビューションの真に新規な部分を既存スキルのモードとして取り込んだ patch release。新モード: deep-research three-way-scan —— quicklit-review の中間に位置する軽量な WHY/HOW/WHAT 論文比較トリアージ。論文ごとのショートリストと論文間の統合を生成(deep-research 2.9.4 → 2.10.0)。academic-paper rebuttal-audit —— 著者の既存リバッタル/応答ドラフトを査読コメントと突き合わせる独立アドバイザリ QA(コメントごとのカバレッジ表 + ギャップリスト + トーン/根拠/誤読のリスクフラグ)。何も生成せず、スタンドアロン実行時は Schema 11/Material Passport 書き込み/ready_to_submit を明示的に抑制(mutation カバレッジ付きの check_rebuttal_audit_guard() lint で強制)。加えて revision-coach のスコープを反論/不同意の姿勢と非ジャーナル文脈に拡張、/ars-3w + /ars-rebuttal-audit スラッシュコマンドを追加。入力形状でルーティング:査読コメント AND ドラフト → rebuttal-audit、コメントのみ → revision-coach@Yaobin29PR #433 から統合。スイートのモード数 25 → 27(スキルは 4 つのまま)。issue ごとの詳細は CHANGELOG.md を参照。

v3.12.0 (2026-06-08) — Kong 自動研究フィーチャートラック:実験来歴・図表フィデリティ・論文間矛盾・部分証拠の分解

[machine-translated] この項目は機械翻訳であり、ネイティブ contributor によるレビュー待ちです。正本は英語版 CHANGELOG です。

Kong et al.(2026、arXiv:2605.18661)の自動研究フィーチャートラックと、部分証拠トラップの分解作業を出荷するマイナーリリース。いずれも個別にレビュー・マージ済み。新機能: 実験来歴インテイク + クレーム↔実験アラインメント — 実験に裏付けられたクレームのための schema-first な証拠台帳層で、インテイクとアラインメントのみ(学者が外部で実験を実行し、ARS は決して実行しない)(#260);キャプションの解釈がデータから導けるか、論文がそのアーティファクトを実際に裏付けるクレームのために引用しているかを検査する図表フィデリティゲート(#261);評価済みの論文ペアを学者の確認用に列挙可能にする構造化された論文間矛盾インベントリ(#262);引用判定(#213)と編集統合(#214)の両層で判定前にサブクレーム分解を行い、両層で §F.3.2 部分証拠トラップを収束させる。ガイダンス・解釈層: レポート生成レビュアーへの簡潔出力 + 圧力耐性境界の強化(#274);同一ファミリ/rubric-aware 較正の認識論的注記(#273);検索コンテンツの命令/データ境界を常設原則として明文化(#367)。ネガティブスコープ: Kong META(#255)をクローズし、POSITIONING.md に ARS が行わない 5 つの自律的メカニズムを列挙する「拒否されたメカニズム」セクションと 2 つの Tier D 設計教訓ドキュメントを追加。リリース規律 lint: version-consistency 不変条件 5–7(#357)と ARCHITECTURE コンポーネントバージョン監査(#345)。さらにクロスモデル grounding ガード(#346 / #349 / #351)、引用ゲートのキャッシュキーと rationale 上限(#359 / #360 / #361)、eval ゴールドセット(#250)、ACL/EMNLP 開示の再接地(#242)の正確性修正を含む。新しいスキーマ、manifest フィールド、すべての不変条件は追加的で後方互換。academic-pipeline は suite に追従して v3.12.0、他の 3 つの skill バージョンは変更なし。issue ごとの詳細は CHANGELOG.md を参照。

v3.11.1 (2026-06-06) — 出荷後の正確性・堅牢化・来歴の修正ロールアップ

v3.11.0 出荷後に表面化した修正をまとめたパッチリリース。いずれも個別にレビュー・マージ済み: integrity-verification + collaboration-depth パスへのクロスモデル同意ゲート拡張 (#322)、エントリ単位の OpenAlex + Crossref バックフィル並列化 (#138)、および引用存在性ゲート・v3.10 ポリシー層・eval ハーネス・ドメイン証拠プロファイル・#310 セキュリティ境界のエッジケースにまたがる 7 件の正確性/堅牢化修正 (#323 / #327 / #328 / #329 / #331 / #332 / #333) — うち 2 件は P1 (#327 no-handoff パスでのドメインプロファイル起動、#328 eval ハーネスのクラス別しきい値ゲート)。新機能なし、破壊的スキーマ変更なし。issue ごとの詳細は CHANGELOG.md を参照。

v3.11.0 (2026-06-04) — 決定論的引用検証ゲート(#182)

[machine-translated] この項目は機械翻訳であり、ネイティブ contributor によるレビュー待ちです。正本は英語版 CHANGELOG です。

LLM ピアレビューとは独立に動作する決定論的な引用存在性検証ゲートを追加。各引用は最大 4 つの書誌インデックス(Semantic Scholar、OpenAlex、Crossref、および新規の arXiv resolverscripts/arxiv_client.py、API キー不要)と照合され、引用ごとの lookup_verified 状態({true, false, unresolvable})が統一サマリに書き込まれる。捏造された、解決できない DOI/arXiv ID を持つ引用は、レビュー agent が気づくことを期待するのではなく、lookup によって検出・マークされる(ユーザーが strict を選択したときのみ終止に昇格)。このゲートは v3.10 の terminal_policies opt-in モデルを継承する。検出は常に実行されるが、lookup_verified == false の行が終止的になるのはユーザーが terminal_policies.citation_existence == strict を選択したときのみで、デフォルトの挙動は advisory(/ars-mark-read で承認可能)である。false の定義は意図的に ID-keyed unmatched に限定(正確な DOI/arXiv で照会して解決できないことが証明された場合)されており、正当だが未索引の人文系 / 非英語 / 地域ジャーナルの引用は unresolvable に分類され、決してブロックされない(ドキュメントに明記された「精度優先・再現率劣後」のトレードオフ)。本バージョンには永続的な SQLite 検証 cache(~/.cache/ars/verification.db、90 日 TTL)と /ars-cache-invalidate コマンド、独立した verification_gate API と verify_passport.py CLI、および v3.9.0 の汚染トライアンギュレーション行列を 4 インデックス(k=0..4、すべて advisory)へ拡張したものも含まれる。academic-pipeline は suite に追従して v3.11.0、他の 3 つの skill バージョンは変更なし。仕様: docs/design/2026-05-21-v3.10-182-promote-citation-gate-spec.md(§0 amendment + C-V6)。

v3.10.0 (2026-06-01) — トライアンギュレーション・ポリシー層、Kong サーベイ採用、評価ハーネス、スコープ書き込みガード

[machine-translated, pending native review by @eltociear]

オプトインの汚染トライアンギュレーション terminal ポリシー層(#127、デフォルトの引用挙動は v3.9.0 と byte-equivalent)、Kong et al. 2026 サーベイ採用(Rebuttal Commitment Ledger #256/#266/#268/#269、分野別の domain evidence profile #259)、v3.10 計測基盤(汎用化された評価 gold set + ranking-lift CI gate #184)、scoped-write guard MVP(#134、23 個の単一フェーズ subagent を各自の phase ディレクトリに囲い込み、Bash を禁止して Grep/Glob と構造化編集ツールに誘導する deterministic な PreToolUse hook)、/ars-mark-read plugin コマンド(#190)と broken-on-arrival 修正(#195)、簡体字中国語 README(#185)、CI 強化(#156/#155)をまとめた minor release。academic-paper → v3.2.0、academic-paper-reviewer → v1.10.0、academic-pipeline → v3.10.0。

v3.9.4.2 (2026-05-19) — PR #149 CI 規律ゲートのポストシップホットフィックス(codex post-ship)

[machine-translated, pending native review by @eltociear]

PR #149(7 つの CI 規律ゲート)の Codex post-ship レビューが 4 つの P2 finding を検出。v3.9.4.2 は 4 つのうち 3 つを強化。F1:harness-retirement-monthly.ymlGH_REPO を追加し、スケジュール実行が gh issue create のための repo context を取得できるようにする。F2:release-cooldown.ymlPREV_TAG ルックアップを v* タグにフィルタリングし、非リリースタグ(例:レガシー plugin タグ)がクールダウンゲートをバイパスできないようにする。F3:release-cooldown.yml が annotated タグの subject も読み取り、hot-fix スペル変種を受け入れる(v3.9.2 は以前の検出器では false-negative hotfix だった)。PR #157 follow-up:[skip-cooldown] override が commit message と annotated タグ message の両方から読み取られるようになる(self-bootstrapping fix — 本タグのクールダウンバイパスが F2+F3 がエンドツーエンドで機能することを実証)。F4(test-count-monotonic 強化)は事前存在する scripts/ パッケージ問題を surface したため revert され、#154(PR #158 で修正済み)+ 再試行 #155 として追跡。Closes #152。Follow-ups:#155、#156。

v3.9.4.1 (2026-05-19) — v3.9.4 temporal verification のポストシップホットフィックス(#135 codex post-ship)

v3.9.4 の Codex post-ship レビューがタスクごとのサブエージェントレビュアーが見逃した 4 つの実バグを検出。ホットフィックスは 4 つすべてにパッチを当てる: (1) audit()citation_provenance を P2 と P4 にスルーする — ref slug が confidence: low または conflict の場合、検証者はタイムライン日付を ground truth として使用する代わりに TEMPORAL-METADATA-MISSING を発行する(spec §3.4 first-party safety check が壊れていた)。(2) _date_to_intervalYYYY-MM(Crossref 月精度)と YYYY-MM-DD..YYYY-MM-DD(区間)を含むすべての schema-valid な日付形状をパース。v3.9.4 ではこれらでサイレントに ValueError してチェックをスキップしていた。(3) P4 は ref マーカーが不在の場合に直接日付キャプチャをバインドする — 「The 2026 policy enabled the 2020 rollout」のような文が実際にトリガーされるようになる。(4) citation_provenance.schema.json confidence:high allOf は非 null に加えて存在(then.required)を要求し、欠落プロパティバイパスを閉じる。1561 passed(v3.9.4 ベースラインに対して +12 新テスト、ゼロリグレッション)。ARCHITECTURE.md を現在の状態に整合(v3.8.0 で陳腐化していた)。

v3.9.4 (2026-05-18) — #135 temporal verification 層(advisory)

Phase 4 → 5 境界における決定論的 advisory 検証者で、5 つの時間的失敗モードをカバー(P1 retrospective arithmetic、P2 anachronistic citation、P3 comparator unmaterialized、P4 causal inversion、P5 deictic present)。新しい Phase 2 兄弟 timeline_extraction_agentphase2_investigation/timeline.yaml + phase2_investigation/citation_provenance.yaml を所有。検証スクリプト scripts/temporal_integrity_audit.py は 5 パスを決定論的に実行。M3 Temporal Integrity Iron Rule を report_compiler_agent + draft_writer_agent に追加。M6-minimal: Crossref issued + pdftotext が first-party 検証をカバー。M7-minimal: 日付来歴 + 比較対象物質化。M5-stub: ユーザー宣言の version_family_id のみ。literature_corpus_entryclaim_audit_resultclaim_intent_manifest への変更ゼロ。bibliography_agent 未変更(F2 不変条件)。3 つの新しいサイドカースキーマ。カバレッジ見積り: ベースライン 55-70% / M7 minimal で 65-75%。1549 passed(+44 新規、ゼロリグレッション)。

v3.9.3 (2026-05-18) — #128 ハウスキーピング(共有クライアントユーティリティ + dedup リゾルバー)

純粋なリファクタリング + v3.9.0 /simplify レビューバックログからの 1 つの潜在バグ修正。scripts/_text_similarity.py(3-way クライアント dedup: normalize / similarity / threshold / retry 定数)+ scripts/_passport_yaml.py(2-way migration tool dedup: ruamel.yaml round-trip 設定)+ プライベート _resolve_by_doi_then_title ヘルパー(2-way リゾルバーボディ dedup、§3.4 / §3.5 API サーフェス保持)を抽出。OpenAlex + Crossref にわたるスロットル測定を time.monotonic に標準化(time.time だった、NTP-unsafe)、Semantic Scholar と整合。5 つすべてのモジュールレベルクロスインポートにおけるデュアルパスインポートインフラストラクチャ(兄弟ファースト、namespace-package フォールバック)は、SemanticScholarUnavailable のクラスアイデンティティを保持し、2 つの潜在的に壊れた import scripts.X パスをボーナス修正。1505 passed(+23 新規、ゼロリグレッション)。#128 §4(OA + CR をエントリーごとに並列化)は #138 に持ち越し。

v3.9.2 (2026-05-18) — #133 フェーズ境界ホットフィックス

133 クロージャー(ホットフィックス層)。長期的アーキテクチャ修正は #134 の v3.10 active conductor として追跡。追加: CLAUDE.md のルーティング明確化ゲート(クロスフェーズ素材 → サイレントディスパッチではなく a-d オプションで明確化)、22 のシングルフェーズエージェントがプロンプトハードフェンス(## Phase Boundary (v3.9.2))を取得、16 のマルチフェーズ / フェーズ直交 / クロスフェーズメタエージェントは意図的に未フェンス(正直なフレーミング — 散文プラセボは false-enforcement の錯覚を生む)、advisory 検証者 scripts/check_pipeline_integrity.py は #133 パターンを post-hoc 検出。クロスモデルスポットチェック付きの動作スモークテスト(100% Opus 4.7、≥75% Sonnet + GPT-5.5)。

v3.9.1 (2026-05-18) — #129 + #130 クライアントハードニング

v3.9.0 ホットフィックス。OpenAlex / Crossref レスポンス読み取り失敗を *Unavailable としてラップ(#129)。非文字列の manifest_id に対して check_claim_audit_consistency をガード(#130)。仕様変更なし。

v3.9.0 (2026-05-17) — #102 cross-index triangulation measurement

102 クロージャー。v3.7.3 は single-index(Semantic Scholar)汚染検出を出荷。v3.9.0 は advisory 証拠のみ として three-index triangulation(S2 + OpenAlex + Crossref)に拡張。2 つの新しいオプションブール(openalex_unmatchedcrossref_unmatched)を contamination_signals に追加。manual-entry not-rule を対称的に拡張。Finalizer は 4 段の advisory matrix(present *_unmatched フィールドに対する k=0/1/2/3)を追加し、v3.7.3 レガシー CONTAMINATED-UNMATCHED は k=1/k_max=1 S2 のみのケースで保持。Formatter pass-through 許可リストは 3 → 9 suffixes に拡張。refusal rules 1-10 は R-L3-2-E に従い未変更。ポリシー層(strict modes、hard-block tier、venue_type / triangulation_policy)は spec §2.3 に従い v3.10 まで保留。k=3 マーカーは CONTAMINATED-TRIANGULATION-UNMATCHED(推論された原因ではなく観測可能を記述)。3 つの新しい firm rules: R-L3-2-C(k は present フィールドに対して計算)、R-L3-2-D(API 推論分類なし)、R-L3-2-E(refusal リスト未変更、pass-through 許可リストは拡張)。

Migration: v3.7.3 コーパス — python scripts/migrate_literature_corpus_to_v3_9_0.py PATH を実行して 2 つの新しいフィールドをバックフィル。Pre-v3.7.3 コーパス — migrate_literature_corpus_to_v3_7_3.py を FIRST に実行、その後 v3.9.0 migration(spec §3.7 に従いデイジーチェーン化、v3.9.0 ツールは既に contamination_signals.semantic_scholar_unmatched を持つエントリーのみに作用)。

v3.8.2 (2026-05-17) — #118 uncited audit_tool_failure サーフェス

118 クロージャー。ARS_CLAIM_AUDIT=1 uncited constraint-judging パスは以前、JudgeInvocationError 時にサイレントに {"judgment": "NOT_VIOLATED"} を代入し、過渡的な judge 停止時に HIGH-WARN constraint チェックを抑制していた。v3.8.2 はこれらの失敗を専用の uncited_audit_failures[] 集約に MED-WARN advisory tier でルーティングし、cited path INV-14 行をミラーするが、claim_audit_result.ref_slug が必須で uncited パスにバインドする ref がないため専用スキーマを使用。#118 issue body の 4 つの option-1..4 トレードオフは option 2(新集約)に落ち着いた — option 4(再 raise してアボート)は flaky judge エンドポイント上の監査カバレッジヒットのため却下。

v3.8.0 (2026-05-16) — L3 Claim-Faithfulness Locator + Audit(ペアマイルストーン)

v3.7.3 + v3.8 は L3(主張忠実性)ギャップを end-to-end で閉じる。v3.7.3 はロケーターインフラストラクチャを出荷 — 各引用は三層アンカーを持ち、将来の監査が引用された一節を取得できる。v3.8 はそれらのアンカーを消費し、引用元が主張を支持するかどうかを判断し、formatter ターミナルハードゲートで HIGH-WARN 違反を gate-refuse する監査パスを出荷。リリースは v3.7.0 以降蓄積された 5 つの audit-trail-shipped feature PR(#104 / #105 / #108 / #111 / #115)もバンドル。

v3.7.0 (2026-05-05) — Claude Code プラグインパッケージング

プラグインパッケージングアップグレード: ARS は /plugin marketplace add Imbad0202/academic-research-skills + /plugin install academic-research-skills 経由で Claude Code CLI / VS Code / JetBrains 上に 1 行でインストール可能に。従来の git clone + ~/.claude/skills/ へのシンボリックリンク フローも引き続き動作 — 両トラックともファーストクラス。

v3.6.8 (2026-05-03) — Generator-Evaluator Contract Gate(v3.6.6 spec ship)

ネーミングノート: このリリースは v3.6.6 generator-evaluator contract spec と 実装を出荷。v3.6.6 作業はプロジェクトシーケンシングのため v3.6.7 後にランディング。 設計ドキュメントは契約ゲートバージョンの v3.6.6 内部命名を保持し、 スイートリリースは CHANGELOG を monotonic に保つため v3.6.8 とタグ付け。

v3.6.7 (2026-04-30) — Downstream-Agent Pattern Protection(Step 1+2)

v3.6.5 (2026-04-27) — Material Passport literature_corpus[] Consumer Integration

v3.6.4 (2026-04-25) — Material Passport literature_corpus[] Input Port

v3.6.3 (2026-04-23) — Opt-in Passport Reset Boundary

v3.6.2 (2026-04-23) — Reviewer Sprint Contract Hard Gate

v3.6.2 は Schema 13 sprint contracts と、reviewer に論文を読む前にスコアリングプランをプリコミットさせるハードゲートオーケストレーションを導入。Reviewer のみのファーストテストケース。writer/evaluator は v3.6.4 まで延期。CHANGELOG を参照。

v3.5.1 (2026-04-22) — Opt-in Socratic Reading-Check Probe

v3.5.1 は Socratic Mentor にオプトイン honesty probe を追加(ARS_SOCRATIC_READING_PROBE=1)。デフォルト off。CHANGELOG を参照。

v3.5.0 (2026-04-21) — Collaboration Depth Observer

v3.4.0 (2026-04-20) — Compliance Agent + Schema 12

v3.3.6 (2026-04-15) — README Streamlining + ARCHITECTURE doc

v3.3.5 (2026-04-15)

v3.3.4 (2026-04-15) — README Changelog Sync Patch

v3.3.3 (2026-04-15) — Release Prep + Lint Hardening

v3.3.2 (2026-04-15) — Data Access Levels + Task Type Metadata

v3.3.1 (2026-04-14) — Spec Consistency Patch

v3.3 (2026-04-09) — PaperOrchestra-Inspired Enhancements

PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)からの技術を統合。

v3.2 (2026-04-09) — Lu 2026 Nature 統合

Lu ら(2026、Nature 651:914-919)からの洞察を統合 — ブラインドピアレビューに合格した最初のエンドツーエンド自律 AI 研究システム。

v3.1.1 (2026-04-09) — IS Senior Scholars' Basket of 11

外部貢献: @mchesbro1 が IS Basket of 8 ジャーナルを最初に提案・起草(Issue #5)。@cloudenochcsis が完全な Senior Scholars' Basket of 11 に拡張(Issue #7PR #8)。academic-paper-reviewer/references/top_journals_by_field.md Section 7 を更新し、Decision Support SystemsInformation & ManagementInformation and Organization を追加。出典: AIS Senior Scholars' List of Premier Journals

v3.1 (2026-04-06) — Anti-Context-Rot + 認知フレームワーク + リーンサイズ

aspi6246/Claude-Code-Skills-for-Academics のパターンに触発される。

Wave 1: Anti-Context-Rot Anchors - 4 スキルすべてにわたる 29 の明示的アンチパターン(スキルあたり 7-8、「Why It Fails」+ 「Correct Behavior」の表形式) - 長い会話でも違反してはならない重要なルールに 22 IRON RULE マーカー - academic-paper-reviewer の read-only 制約(reviewer は原稿を修正できない)

Wave 2: トレーサビリティ + 認知フレームワーク + 強化 - R&R Traceability Matrix(Schema 11): 再レビュー出力に「Author's Claim」と「Verified?」列を追加し、改訂主張の独立検証を可能に - エージェントに「何をするか」だけでなく「どう考えるか」を教える 3 つの認知フレームワークリファレンスファイル: - argumentation_reasoning_framework.md — Toulmin model、Bradford Hill 因果推論、inference to best explanation、epistemic status classification - review_quality_thinking.md — 3 つのレンズ(internal validity、external validity、contribution)、一般的なレビュアートラップ、キャリブレーション質問 - writing_judgment_framework.md — clarity test、reader's journey、discipline-specific voice、revision decision matrix - 会話中強化プロトコル: パイプライン遷移ごとのステージ固有 IRON RULE + アンチパターンリマインダー - 各 FULL チェックポイントでのセルフチェック質問(引用整合性、シコファント譲歩、品質軌跡、スコープ規律、完全性)

Wave 3: リーンスキルサイズ - SKILL.md 合計サイズを 142KB から 85KB(-40%)に削減、詳細プロトコルを references/ ファイルに抽出 - ~15 の新しいリファレンスファイル作成(re-review プロトコル、ガイドモード、systematic review、process summary、external review など) - すべての IRON RULE マーカーは SKILL.md に保持。詳細コンテンツはオンデマンドでロード - 新バージョン: deep-research v2.7、academic-paper v2.8、academic-paper-reviewer v1.7、academic-pipeline v3.0

v3.0 (2026-04-03) — Anti-Sycophancy + Intent Detection + Dialogue Health

v2.9.1 (2026-04-03) — Skill Metadata

v2.9 (2026-03-27) — Style Calibration + Writing Quality Check

v2.8 (2026-03-22) — SCR Loop Phase 1: State-Challenge-Reflect

v2.7 (2026-03-09) — Integrity Verification v2.0: アンチハルシネーションオーバーホール

v2.6.2 (2026-03-09) — 意図ベースモードアクティベーション

v2.6.1 (2026-03-09) — バイリンガルトリガーキーワード

v2.6 / v2.4 / v1.4 (2026-03-08) — 15+ の改善

v2.4 / v1.3 (2026-03-08)

v2.3 / v1.3 (2026-03-08)

v2.2 / v1.3 (2025-03-05)

v2.0.1 (2026-03)

v2.0 (2026-02)

v1.0 (2026-02)