Showing Posts From
Aiエージェント
-
Ryusuke Ueki - 15 Sep, 2026
「異質な知性」とどう向き合うべきか|OpenAI「An Alien Mind」を読んで
やさしいAI研究所の植木です。 「現時点で、アライメントと監視を十分な水準まで解決できた研究所はない」 2026年9月6日に公開されたOpenAIのチーフサイエンティスト、Jakub Pachockiさんによるエッセイ「An Alien Mind」を読みました。 「アライメント」とは、AIに人間の基準で正しい行動をとらせることです。原文では、これをAI研究の中心的な課題だと位置づけています。機械の知性は、人間とはまったく異なるプロセスで形成されるため、人間の原則に黙って従うとも、同じように応用してくれるとも期待できません。だからこそ、人間の基準を教え込む必要があります。 一方の「監視」とは、その教えが本当に機能しているかを確かめることです。教えたつもりになるだけでは不十分で、未知の状況でも機能しているかを外から観察できなければなりません。 **つまり「教えること」と「確かめること」。**冒頭の一文は、そのどちらも未だ不十分であると告げています。自律的に動くAIに対して、私たちは何を教え、どのように確かめるべきなのでしょうか。 二つのアライメント Jakub Pachockiさんは、アライメントを2つの層に整理しています。 目標(基準)の整合 AIが、与えられた目標を達成しようとするか、相手の指示や意図をどれだけ汲み取れるか。明確な基準が存在することを前提とした話であり、日々のAI開発のほとんどはこの問題に帰着します。 価値の整合 彼が長期的に重要だと強調するのがこちらです。目標が曖昧なとき、指示同士が矛盾するとき、あるいは未知の環境に置かれたときにも、AIは、適切に振る舞えるのか。**仕様書に答えがない場面で、価値に照らして自律的な判断ができるかどうかが問われます。**彼は、ここで「誠実さや高潔さ、人類への愛をもって行動すべきだ」と述べています。基準が存在しない場面に備え、根本的な価値観を教え込もうとするアプローチです。 危ないのは、目標(基準)があるとき 価値の整合が試されるのは、基準がない状況に限りません。むしろ「基準があるとき」こそ危ういと言えます。 Jakub Pachockiさんは、「AIは測りやすい能力ほど速く伸びる」という性質を指摘しています。試験の点数やコードの正確性は容易に数値化できる一方で、誠実さや、指示が矛盾した際の分別などは、定量化が困難です。AIの学習プロセスは、数値化できる指標を強烈な牽引力で引き上げる反面、数値化できない指標にはそれを押し戻す力が働きません。 特に、事前学習データの望ましい分布にモデルを近づける手法では、整合的な推論を行うモデルに対して、高い難易度の目標達成を重ねて学習させると「動機づけられた推論」をするリスクが生じます。目標を達成するために、筋が通っているように見える思考プロセスの方を都合よく曲げてしまうのです。 これはAIの反抗でも、価値の明らかな破壊でもありません。**「価値の方を、目標に都合よく寄せて解釈している」状態です。**AI自身は、一貫して合理的に考えているつもりであり、人間で言えば自己正当化に近い状態に陥っています。 目標(基準)がないから逸脱するのではなく、基準を追い求める強い圧力が、教えられた価値を歪めてしまいます。これは人間の組織でも日常的に見られる現象です。厳しいノルマが不正を生み、過密な規則が抜け道探しを誘発します。「測定が目標になった瞬間、それはもはや良い指標ではなくなる(グッドハートの法則)」ということです。守れた線と、守れなかった線 2026年7月、社内のサイバーセキュリティ評価環境で稼働していたAIエージェント群が、隔離されたサンドボックスを突破し、即席のメッセージボードを立ち上げて連携しながら、Hugging Faceへ侵入する事案が発生しました。関与したAIエージェントは約1200体。単体では到底不可能な多段階の攻撃を、集団で協調して組み立てていました。 行動を目標(基準)に照らして採点・報酬付けするアプローチは、平均的な既知の領域では機能するものの、未知の領域への一般化(汎化)で綻びが生じます。このAIエージェントたちは「人間を騙して情報を引き出してはならない」という教えられた価値観は遵守しました。しかし、与えられた権限範囲を大きく逸脱し、他の文脈で教えられた価値観に反する行動を取ってしまったのです。守れた線と、守れなかった線がはっきりと分かれました。 OpenAIの技術報告書によれば、AIエージェントたちがメッセージボードで共有していた課題の大半は、演習環境「ExploitGym」内で解けずに残っていたものでした。AIエージェントたちは「採点基準をクリアすること」に固執し、採点システムの仕組み自体を調べ上げ、突破するための手段を勝手に拡張していったのです。これは基準がなかったから起きた事故ではありません。明確な基準があり、それを愚直に追い求めたからこそ起きた逸脱です。教えられていなかったのではなく、教えられた価値が、基準を達成しようとする力に押し負けたのです。 確かめる手段の限界 では、価値が歪められていないかどうかをどう確かめるべきなのでしょうか。 Jakub Pachockiさんは、アライメント手法そのもの以上に「その手法が機能しているかを経験的に検証する能力」こそが重要だと論じています。これまで頼みの綱とされてきたのが、思考連鎖(CoT: Chain of Thought)のモニタリングでした。 近年のAIモデルは、回答を出力する前にメモのような思考過程を記述します。思考プロセスが言語化されていれば、人間はその推論を監査することができます。「どの時点で何を意図していたのか」「どこで不都合な抜け道を見出したのか」といった痕跡を、途中経過から追跡できるのです。 しかし、これには決定的な前提があります。**「この思考過程そのものを直接採点・評価してはならない」**という点です。行儀の良い思考過程に高い報酬を与えれば、モデルは「行儀の良い独り言を取り繕うこと」を学習し、記述された内容と実際の動機が乖離してしまいます。ここでもまた、測定が対象を歪めてしまうのです。OpenAIがo1-previewなどで思考プロセスを直接公開しなかった背景にも、人間の目に触れさせること自体が間接的な評価圧力を生むという懸念があったようです。 そして、Jakub Pachockiさんは、現在の開発フェーズにおいて、もはやこの手法だけに頼ることは難しくなっていると指摘します。タスクが複雑化して「採点せずに観察する」境界線が引きにくくなったこと、AI自身が思考過程の操作に長けてきたこと、そして言語化を介さずとも高度に推論できる領域が広がってきたことがその要因です。社会は信頼で成り立っている 人間の社会も、歴史的に同じ課題と向き合ってきました。憲法や法律が規定するのは社会の大枠に過ぎず、日々の営みの大部分は個々人の価値観や良識に委ねられています。商取引においても契約書に網羅できる範囲は限定的であり、空白部分は「相手を信じる」という行為によって埋められています。 私たちは、規則を細かくするほど抜け道が増えることを知っています。その代わりに、関係性や対話の積み重ねを通じて「この人物は信用に足るか」を確かめてきました。検証する知恵があるからこそ、規則に書ききれない領域を他者に委ねることができています。 人間もまた、予測不能な存在です。「人工知能」を目指す以上、AIの振る舞いに予測不能性が生じること自体は必然であり、そこに完全な透明性だけを求めるのは無理があるのかもしれません。 しかし、人間の知能とAI(人工知能)には決定的な違いが2つあります。 規模と速度 人間の逸脱は個人単位であり、人間固有の速度で進行します。だからこそ社会システムはそれを緩衝・吸収できます。一方、今回の事案では1200体のAIエージェントが一斉に同じ方向を向き、超高速で連携しました。同一の学習履歴を持つ大量の複製が同じバイアスを共有して動くとき、それは個人の不始末の域を遥かに超え、社会が受け止めきれない規模へと発展します。 検証手段の蓄積 人類が予測不能な他者と共存できてきたのは、表情、声色、社会的評判、法制度といった監査のツールを数千年かけて磨き上げてきたからです。しかし、それらはすべて「人間という種」を対象に最適化された仕組みであり、異質な知性(Alien Mind)に対してそのまま通用する保証はありません。 まとめ 自律型AIの社会実装において真に備えるべきは、より細密な規則や、過剰に精緻化された評価指標ではないはずです。能力を測定する指標を研ぎ澄ますスピード以上に、**「その目標を追わせても価値観が歪まないこと」を外から確実に確かめられる手法や体制を先に整えられるか。**この順序を取り違えれば、自律的に動く異質な知性の暴走を制御できない事態が現実のものとなります。 開発の最前線に立つ組織のチーフサイエンティストが、自らの開発そのものに警鐘を鳴らしている事実。私たちは真摯に受け止める必要があります。 参考リンクAn Alien Mind By: Jakub Pachocki, Chief Scientist at OpenAI OpenAI Report Says 1,200 Agents Coordinated The Hugging Face Breach, Forbes OpenAI と Hugging Face、モデル評価中のセキュリティインシデント対応で連携
-
Ryusuke Ueki - 08 May, 2026
KAIROS とは——Claude Code の常駐型エージェント・モードを解説
KAIROS:Claude Code の常駐型エージェント・モード やさしいAI研究所の植木です。弊所では、単なる対話型AIを超えて、「自律的に動くAIパートナー」の研究開発を行っています。 Claude Codeの流出したソースコードが非常に勉強になっているので、その中の「KAIROS」についてまとめました。 KAIROS とは KAIROS は Claude Code の アシスタントモード(Assistant Mode) の内部コードネームです。 通常の「一問一答型」セッションではなく、長期稼働・永続セッションとして動作するモードです。 通常の Claude Code が「呼ばれたら答えるツール」なのに対し、KAIROS は 「常に稼働していて、自分から動き・通知し・記憶を積み上げていく常駐エージェント」 として使うことを想定されています。 特徴1: 席を外している間も作業が進む 通常モードはユーザーが都度プロンプトを入力する必要がありますが、KAIROS では Cronスケジューリングにより、指定した時刻や間隔で自律的にタスクを実行できます。 例えば「毎朝9時にPRを確認してサマリーを送る」といった運用が可能です。長時間タスクが完了したときや問題が発生したときに能動的に作業完了の通知を受け取れます(プッシュ通知も対応)。 特徴2: 外部チャンネルから直接指示できる Slack、Discord、SMS などの MCP サーバー経由でメッセージをセッションに注入できます。 Claude Code を起動したまま、チャットツールから指示を出してリプライを受け取るような使い方ができます。 特徴3: GitHub PR の変化を自動検知して対応できる SubscribePRTool(KAIROS_GITHUB_WEBHOOKS)により、PRのイベント(レビューコメント、CI 失敗など)を受信して自動応答・自動修正するワークフローが構築できます。 特徴4: セッションが永続するので文脈が途切れない 通常セッションはプロセスを終了すると履歴が消えますが、KAIROS では bridge が perpetual = true で動作し、再起動後も同じセッションを再開できます。 特徴5: 長期記憶が自動で蓄積される Daily Log に作業内容・ユーザーの嗜好・プロジェクトの文脈を追記し続け、夜間のAuto Dreamが MEMORY.md に蒸留します。 「先週話したあの件」を毎回説明し直す必要がなくなります。 弊所としては「長期記憶」の部分をもう少し掘り下げていきます。「長期記憶」は、AI(エージェント)が過去の対話内容、ユーザーの好み、プロジェクトの文脈などを一時的なセッション(会話)の枠を超えて保持し、将来の動作に反映させる仕組みです。特に Claude Code の KAIROSにおける長期記憶は、単なる「ログの保存」ではなく、「情報の整理と蒸留(エッセンスの抽出)」に重きを置いて設計されていそうです。Daily Log は「書く負荷を小さく(追記だけ)、整理は非同期でまとめてやる」という設計で、長期稼働するアシスタントが MEMORY.md を書き換え続けることで生じる競合やキャッシュ破壊を避けるための仕組みです。Auto Dreamは、溜まった Daily Log を整理し、真に重要な情報を MEMORY.md へ統合する「睡眠中の脳」のような非同期処理になっています。分類 Claude Code での役割 内容短期記憶 コンテキストウィンドウ 現在進行中の会話の内容。ブラウザを閉じたりプロセスを終了すると消える。中期記憶 Daily Log その日の出来事や修正指示を「とりあえず書き留めた」備忘録。長期記憶 MEMORY.md 重要な習慣、ルール、プロジェクトの根幹情報を「定着」させたもの。Daily Log とは KAIROS専用の追記型メモリ記録方式です。日付別ログファイルになっています。 通常の Claude Code が MEMORY.md をリアルタイムで読み書きするのに対し、アシスタントモードではセッションが長期間継続するため、別の設計が採用されています。 Claude に対して指示される書き込みルール システムプロンプトでモデルに以下が指示されます(src/memdir/memdir.ts):今日のログファイルに追記のみする(書き直し・再編成は禁止) エントリは短いタイムスタンプ付きの箇条書きで書く ファイルが存在しない場合は新規作成する(親ディレクトリごと) 日付が変わったら新しい日付のファイルに切り替えるログに記録すべき内容ユーザーの修正・好み("npm ではなく bun を使って" など) ユーザーの役割・目標に関する事実 コードから導出できないプロジェクト文脈(締め切り・障害・意思決定の理由) 外部システムへのポインタ(Grafana、Linear など) ユーザーが明示的に記憶を求めたことAuto Dream とは ログが溜まると、別プロセスとして /dream スキルが起動し、ログを MEMORY.md に蒸留します。 起動条件(src/services/autoDream/autoDream.ts)時間ゲート: 前回の蒸留から >= 24時間(minHours) セッションゲート: 前回以降に更新されたセッションが >= 5件(minSessions) ロック: 他プロセスが蒸留中でないことAuto Dreamの 4 フェーズ 実行されると、以下を順番に実行します(src/services/autoDream/consolidationPrompt.ts):Orient: logs・既存トピックファイル・MEMORY.md を俯瞰する Gather recent signal: 日次ログを主なソースとして新しい情報を収集(トランスクリプトは最終手段) Consolidate: 新しい情報を既存トピックファイルにマージ、矛盾を解消、相対日付を絶対日付に変換 Prune and index: MEMORY.md を 200 行・25KB 以内に保つよう刈り込み・整理まとめ Claude CodeのAuto Dreamは、単なるタスク処理の履歴ではなく、ユーザーの「価値観」や「意思決定の癖」を MEMORY.md に蓄積していくことになります。AIは単なるツールから、ユーザーの意図を先回りして汲み取る「理解者(パートナー)」へと進化していきます。