サイト内検索

Astra と Fable を参謀に、Human が判断し、Codex と Claude Code が実行する

重岡 正 · Thu, September 24, 2026

この半年で、1 日の仕事の進め方が「参謀層・意思決定層・実行層」の 3 層にはっきり分かれてきました。参謀層には OpenAI の GPT-6 Astra と Anthropic の Claude Fable 5.1 を置き、意思決定層は Human(私)、実行層には OpenAI Codex と Claude Code のサブエージェント群、そして自作の Hermes Agent 用スキルを並べています。

この構成は、以前書いた Fable 5 Low で計画・Codex 5.6 Sol Light Fast で実装する 2 モデル体制 や、モデル選びを機会コストで決める話 の派生で、計画と実装の役割分担を外側へ 1 段広げたものです。GPT-6 Astra が入ったことで、Fable が主にコードベース内側の計画、Astra が外側(新規領域調査・外部挙動確認)の相談役、という使い分けが整理できました。

この記事では、2026 年 9 月時点でチームを 3 層に分けている理由、各層が引き取っている判断、参謀から実行層への引き渡し方、そして自律的に進められる範囲をどう広げているかを書き留めます。

3 層の全体像

全体の流れは次のとおりです。

flowchart LR
  A["参謀層<br/>GPT-6 Astra / Claude Fable 5.1"] -->|"計画・候補・比較"| H["意思決定層<br/>Human(私)"]
  H -->|"採用した計画と仕様"| E["実行層<br/>Codex / Claude Code / Hermes Agent スキル"]
  E -->|"差分・調査結果"| H
  H -->|"補足・方針更新の相談"| A

参謀層は、「何をどう進めるか」の候補を言語化してもらう層です。コードや仕様を読んだうえで、設計の分岐、トレードオフ、未解決の疑問を並べてもらいます。決定は求めません。

意思決定層は、どの候補を採用するか、何をやって何をやらないか、どこまでエージェントに任せるかを決める層です。他に任せません。

実行層は、確定した仕様に沿って差分を返す、調査結果をまとめる、長時間のバックグラウンドタスクを回す、という係です。

参謀層: Astra と Fable の使い分け

参謀層の 2 モデルは、相談する対象で使い分けています。

  • GPT-6 Astra: 新規領域の調査、英語の 1 次情報の読解と比較、Computer Use API を伴う外部挙動の確認、既存コードベースの外側にある判断材料集め
  • Claude Fable 5.1: 既存コードベースの読解と設計、長い会話文脈を跨いだ一貫した追従、Claude Code の会話文脈のなかで直接コードを読みながら計画を立てる局面

Astra は ChatGPT のデスクトップアプリや Computer Use API 相当の相談役、Fable は Claude Code の会話文脈のなかで動く計画役、という配置です。同じ問いを両方に投げて差分を見てから判断する、というやり方を取ることが多く、両方の意見を並べて見比べる前提で使っています。

参謀に「決めてほしい」と頼むことはしていません。これは Loop Engineering を既存プロダクトに持ち込んで痛い目を見た経験から来ていて、判定基盤が弱い領域でモデルに決定権を渡すと、通ってしまうゲートの下で負債が溜まる、という失敗を踏んだためです。

意思決定層: Human が引き取り続けている判断

Human に残してあるのは、次のような決定です。

  • 何に時間を使うか: 優先度と順序の決定
  • 設計の最終決定: トレードオフが揃った段階で、どちらを採用するか
  • プロダクトの価値判断: UX、料金、プライバシー、ブランド一貫性に関わる判断
  • セキュリティ・権限・課金の操作: トークン発行、権限付与、外部送信、課金が発生する操作の承認
  • 外部に出す文面: 顧客・候補者・コミュニティへのメッセージの最終版

ここは 2026 年 9 月時点でも、参謀に相談はしても、決定を任せていません。モデルが決定を間違えたときに、1 回のレビューでは差し戻せない影響範囲に出てしまう操作だからです。

一方で、Human が決めている判断の輪郭は、半年前より少しずつ内側に縮んでいます。たとえば、半年前は「どのライブラリを採用するか」まで自分で手を動かして比較していましたが、今は Astra に比較表を出させ、Fable に実装側から見た適合度を聞き、両者を並べて自分で選ぶ、という形になっています。選ぶのは Human のままですが、比較を集める作業は手放しています。

実行層: Codex と Claude Code サブエージェントが実行する

実行層は、確定した仕様を機械的に差分へ落とす係です。Codex は 5.6 Sol を推論レベル Light・速度レベル Fast で、Claude Code は Claude Opus 5.5 をデフォルトにしています。Claude Code で計画を相談するときだけ、モデルを Fable 5.1 に切り替えています。計画と判断は参謀層・意思決定層で済ませているので、Claude Code 側は 1 差分の精度を取るために Opus 5.5 を置き、Codex 側は量を速くこなすために軽い設定を続けています。

実行層に任せているのは、おおむね次の作業です。

  • 実装: 計画で確定した差分の生成
  • 読解・調査: ドキュメント・コード・ログの横断読み
  • バックグラウンドで走らせる長時間タスク: Codex のバックグラウンドエージェントで、Human が別の作業をしているあいだに回しておくもの
  • Hermes Agent 用スキル経由の定型実行: ブラウザ UI 操作・外部 API 呼び出しを含む定型作業

実行層には、仕様を跨いで判断させません。計画で書いていない設計変更が必要になったときは、エージェントに決めさせずに Human に戻します。この境界は、スキルの SKILL.md 側で「このスキルが実行しない操作」として明文化することに揃えています。

参謀層から実行層への引き渡し

参謀から実行層へ渡すときは、必ず計画を仕様の形に書き直します。会話文脈に残しただけの指示は、実行層が別の解釈をしても止める手がかりがないためです。

仕様の形は、おおむね次の 3 項目です。

  • 範囲: 触る対象、触らない対象、呼び出す側・呼ばれる側の境界
  • 受け入れ基準: 完了を判定するテスト、変更後の挙動、残してはいけない痕跡
  • 禁止操作: 代替手段で終わらせない、承認なしに進めない、拡張を途中で足さない

この 3 つを書き切ってから Codex や Claude Code に渡すと、差分が意図通りの範囲に収まる確率が上がります。範囲外に出た差分はレビューで差し戻し、計画側に戻って書き直させます。

参謀層との会話は仕様化で止まらず、実行層が持ち帰ってきた差分の読み直しにも使います。「計画からズレて見える箇所がある。これは意図されたズレか、計画の抜けか、別の判断が必要か」を Astra や Fable に投げて、見解を揃えてから Human が判断する、という流れです。

自律化範囲を広げるループ

この体制を回しながら、Human が毎回判断していた一連の操作が繰り返されたら、Hermes Agent 用スキルとして固定しています。固定したスキルは、参謀層が計画→Human が承認→スキルが実行、で済むようになります。

スキル化するかどうかの判断は、次の順で見ています。

  • 繰り返しの回数: 3 回以上同じ判断を手動で下しているか
  • 判断の記述可能性: 条件分岐を自然言語ではなく、SKILL.md とスクリプトで書けるか
  • 承認の自動化可否: 権限・課金・外部送信・プロダクトの価値判断に関わらない操作か

3 つめの承認の自動化可否は、特に慎重に見ています。スキルの SKILL.md にも、承認なしに進めない、代替手段で終わらせない、といった禁止操作を書き込み、スキル側で Human の判断を迂回しないように作っています。

結果として、Human が毎回判断していた操作の数は、1 か月前と比べて減っています。

一方で、参謀に計画してもらうべきことも、1 か月前より増えています。スキル化できる範囲が広がったぶん、スキルの外側の判断、たとえば「どのスキルを作るか」「どのスキルで禁止操作をどこまで広げるか」の設計判断に参謀の助言を使う機会が増えました。

この体制で崩れるケース

このやり方で、うまく回らなくなる局面もあります。デイリースタンドアップやチームミーティングで振り返るときに挙がる崩れ方を、いくつか書いておきます。

  • 参謀が過剰に自信を持った計画を出し、Human レビューが追いつかない: 計画の分量を Human が読み切れない厚さにしないよう、1 回の相談で扱う範囲を狭めるようにしました
  • 実行層が仕様を解釈し直して範囲外に出る: 禁止操作を SKILL.md と仕様プロンプトに明文化し、範囲外の差分はレビューで差し戻すようにしました
  • 承認の自動化を広げすぎる: 権限・課金・外部送信に関わる操作は、承認を省かないことを運用ルールに固定しました

これらは、どれも Human の判断を参謀や実行層に押し付けたときに起きています。崩れたときの戻し方は共通で、Human の判断範囲を内側に戻し、参謀と実行層には助言と実行だけに集中させる、という手直しです。

以上、Astra と Fable を参謀に置き、Human が判断し、Codex と Claude Code が実行する 2026 年 9 月時点のチーム体制と、自律化範囲を広げるループを整理した、現場からお送りしました。

参考情報