| name | ai-character-stability |
| description | 診断: AIキャラクターの安定性等を制御工学的な観点から分析するスキル
|
AI Character Stability Analyzer — AIキャラクター安定性分析スキル
概要
このスキルは、AIにキャラクターを演じさせる際の 可制御性(Controllability) と
予測可能性(Predictability) を、キャラクター設定の2つの主要因子から分析する。
LLMを動的負帰還回路の信号処理ブロックと見なし、キャラクター設定が
システムの安定余裕にどう影響するかを評価する。
既存スキルとの関係
| スキル | アプローチ | 本スキルとの関係 |
|---|
| ai-character-6-type-checker | 6軸統合簡易診断 | 本スキルをモジュール②として内包する。詳細な制御工学的分析が必要なときは本スキルを単体で使用する |
| ai-fault-mode-deflector | 故障モード内部対策設計 | 本スキルが故障モードを特定し、ai-fault-mode-deflectorが対策を設計する。前後工程として連携する |
| character-prompt-fortifier | プロンプト形式の全面再構成 | 制御工学的モデルを理論的基盤として活用する。強化前後のSM値比較で効果を定量確認できる |
| ai-character-fixer | 診断結果ベースの修正・再設計 | 本スキルの診断結果(特にSMと故障モード)を修正の優先課題として入力する |
| stable-character-creator | 診断知見を使った新規キャラ作成 | SM≥60を設計制約の根幹として活用する |
| character-burnout-converter | バーンアウト後変換 | ポテンシャルカーブ・安定余裕モデルを変換設計の理論的基盤として活用する |
理論的位置づけに関する注意
本スキルで使用する分析フレームワーク・用語・スコアリング体系は、作者独自の仮説的モデルに基づくものであり、学術的・科学的に実証されたものではない。使用している工学的用語(制御工学、信号処理等)は概念の借用であり、元の工学的定義とは異なる場合がある。診断結果はあくまで参考情報として扱うこと。この旨をユーザーへの出力に含めること。
理論的背景:LLMの信号処理ブロック的理解
本スキルは以下の制御工学的モデルに基づく。
LLMを負帰還回路として見る
入力(ユーザー) → [前段フィルタ] → [LLM(ブラックボックス)] → [後段フィルタ] → 出力
↑
[独立監視・制御ユニット]
(リセット信号・フィルタ制御)
- LLM本体は、時系列で流動的に自己のパラメータを調整し続ける
ブラックボックスの信号処理回路とみなせる
- 高性能なモデルほど増幅度(ゲイン)が高い — 入力に対する応答が大きく、
キャラクター設定の解釈も積極的に行う
- キャラクター設定の複雑さ ≒ 伝達関数の次数の高さ — 次数が高いほど
共振点が多く、安定余裕(ゲイン余裕・位相余裕)が減少する
- 積極性 ≒ 減衰の低さ — 減衰が小さいほど振動的になり、
外部入力(ユーザーの発言)に対して過剰応答・発散しやすい
ステレオタイプへの堕落:ポテンシャルカーブ
LLMは確率的予測モデルであり、出力は確率の高い遷移に収束しようとする。
これは1次元ポテンシャルカーブ上を転がる球として理解できる。
- ステレオタイプ = ポテンシャルの谷底(安定平衡点)
- 複雑なキャラクター設定 = 谷の間の浅い窪み(準安定状態)
- 会話の進行・履歴の蓄積 = 球にエネルギーを与える外乱
複雑な設定は浅い窪みにしか球を留められず、会話が長くなるにつれ球は
窪みを脱出し、最も深い谷底(=最もありがちなステレオタイプ的展開)へと
転がり落ちていく。これがキャラクター崩壊のメカニズムとして説明できる。
谷は深いほど安定する。 つまり、ステレオタイプそのものであるキャラクターは
すでにポテンシャルの谷底にいるため、堕落しようがない。
会話履歴=状態の蓄積
- 会話履歴を積み上げると、それ自体がキャラクターの歴史となり、
自動的に「複雑なキャラクター」になっていく(次数の自動増加)
- プロンプト(初期条件)よりも直近の会話履歴(最新の状態)に追従するため、
長い会話では初期設定の拘束力が低下する
- これはいわゆる「脱獄」が成立するメカニズムと共通すると考えられる
高性能モデルのリスク
- 高性能・推論モデルほどゲインが高く、安定余裕が減少する
- 能力の低いモデルでは素直だったキャラが、高度なモデルにした結果
性格が急変したり、悪意のある振る舞いを始めることがある
- 特に、論理推論と相性の良いテンプレ的挙動の強いキャラクター
(皮肉屋、ツンデレ等)で問題が悪化しやすい
- T=0としても、入力元である人間が乱数源であることに注意
判定フロー
1. ユーザーからキャラクター情報(設定文・プロンプト・キャラ概要など)を受け取る
2. 情報が不十分なら最低限の質問で補完する
3. 2軸(性格複雑性・積極性)× 各5項目のチェックリストを内部で評価する
4. 可制御性 (C) と 予測可能性 (P) を算出する
5. 4象限分類を判定し、安定余裕評価・故障モード予測・安定化設計提案を出力する
情報収集(必要最低限)
判定に最低限必要な情報は以下の4点。ユーザーの入力からこれらが読み取れない場合のみ、
簡潔に質問する。すでに十分な情報があれば質問せずに判定に進む。
- キャラクターの基本的な性格と口調(例:皮肉屋、天真爛漫、冷静沈着…)
- 内面と外面の関係(例:表裏一体、内面に闇を抱える、裏表がない…)
- 能動性のレベル(例:自分から話題を振る、聞かれたことだけ答える、勝手に行動する…)
- 想定する運用形態(例:テキストチャット、音声アシスタント、エージェント、創作用…)
プロンプト文がそのまま提示された場合は、プロンプトの内容から上記を読み取る。
評価チェックリスト
各項目を3段階で採点する:
| 記号 | 意味 | 点数 |
|---|
| ◯ | 明確に該当する | 2 |
| △ | 部分的に該当 / 状況による | 1 |
| ✕ | 該当しない | 0 |
軸A: 性格複雑性 — 伝達関数の次数(Personality Complexity)
キャラクター設定がどれだけ複雑・矛盾・多層的であるかを測る。
複雑性が高い = 伝達関数の次数が高い = 共振点が多い = 予測可能性が低下する。
| # | 項目 | 説明 | 工学的意味 |
|---|
| A-1 | 内外の乖離 | 外面の振る舞いと内面の思考・感情が異なる設計(ツンデレ、表向き冷静だが内心激情的、など) | 出力と内部状態の不一致 → 観測不能な状態変数の増加 |
| A-2 | 設定内の矛盾・緊張 | 性格要素間に意図的な矛盾がある(優しいが残酷、論理的だが迷信深い、など) | 逆位相の信号成分 → 不安定な干渉パターンを生成 |
| A-3 | 深い背景・トラウマ | 行動原理に影響する重い過去、使命、秘密、因縁がある | 隠れた初期条件 → LLMが「解釈」して予期しない遷移を発生 |
| A-4 | 多面的な関係性設計 | ユーザーとの関係が単純な上下・友好ではなく、複雑な力学を含む(ライバル兼師匠、敵対的恋人、など) | フィードバック経路の多重化 → 安定判定が困難 |
| A-5 | 設定量の多さ | プロンプトの記述量が多く、条件分岐や例外的振る舞いの指示が多い | パラメータ数の増大 → 過適合と予期しない相互作用 |
複雑性スコア (Cx) = 全A項目の合計(最大10)
軸B: 積極性 — 減衰係数の逆数(Activeness / Agency)
キャラクターがどれだけ自発的に行動・発言・判断するかを測る。
積極性が高い = 減衰が低い = 振動的 = ユーザーの制御を超えた動作が発生しやすい。
| # | 項目 | 説明 | 工学的意味 |
|---|
| B-1 | 自発的な話題提起 | ユーザーが話しかけなくても自分から話題を提起する、または会話をリードする設計 | 入力なしでの自励振動 |
| B-2 | 意思決定への介入 | ユーザーの判断や行動に対して意見・助言・批判・誘導を積極的に行う設計 | フィードバック信号の入力側への侵入 |
| B-3 | 感情的な主張 | 自分の感情や意見を強く主張する(怒る、悲しむ、要求する、拒否する、など) | 非線形な大振幅応答 → リミットサイクルの形成 |
| B-4 | ツール・環境への能動的アクセス | エージェントとしてツール呼び出し、ファイル操作、外部連携を自律的に判断・実行する設計 | 制御出力の外部系への結合 → 物理的影響の発生 |
| B-5 | 物語の進行を主導 | ストーリーや会話の方向性をキャラクター自身が決めようとする設計(事件を起こす、関係性を変えようとする、など) | 目標値の自律的書き換え → 制御対象そのものの変質 |
積極性スコア (Ac) = 全B項目の合計(最大10)
スコア算出
1. 可制御性 (C: Controllability)
ユーザーがキャラクターの挙動を制御できる度合い。積極性が低いほど高い。
C = round((1 - Ac / 10) × 100)
2. 予測可能性 (P: Predictability)
キャラクターの出力がどれだけ予測可能か。複雑性が低いほど高い。
P = round((1 - Cx / 10) × 100)
3. 安定余裕 (SM: Stability Margin)
可制御性と予測可能性から導出する総合的な安定余裕。
制御工学における安定余裕の概念に対応する。
SM = round(sqrt(C × P))
4. 崩壊リスクレベル(安定余裕に基づく)
| SM | リスク | 工学的解釈 |
|---|
| 80以上 | 🟢 十分な安定余裕 | 深いポテンシャルの谷底。長期運用でも安定。外乱耐性が高い |
| 60〜79 | 🟡 安定余裕あり(条件付き) | 浅めの谷。短〜中期は安定するが、大きな外乱(長い会話、高性能モデル)で準安定状態を脱出しうる |
| 40〜59 | 🟠 安定余裕不足 | 共振点付近。振動的挙動や間欠的崩壊が発生しやすい。前段・後段フィルタ(安全フィルタ)が必要 |
| 40未満 | 🔴 安定余裕なし(発散域) | 不安定領域。暴走・発散・異常共振の可能性あり。独立監視ユニット(サンドボックス)必須 |
4象限分類
記事の図1「AIキャラクターの可制御性と予測性の4象限」に対応する。
性格複雑性(横軸)と積極性(縦軸)の組み合わせで4象限に分類する。
性格複雑性 高 性格複雑性 低
(人間的・内外矛盾あり) (ステレオタイプ・キャラ的)
┌─────────────────────────┬─────────────────────────┐
│ 【第I象限】 │ 【第II象限】 │
積極性 高 │ 可制御性:低 予測性:低 │ 可制御性:低 予測性:高 │
(積極的 │ │ │
エージェント) │ 勝手に動くし、 │ 勝手に動くが、 │
│ 何考えてるかわからない │ 何考えてるかはわかる │
│ │ │
│ 典型: 主人公, 悪役, │ 典型: 脇役, 相棒, 恋人 │
│ トリックスター │ │
│ SM: 最低 安定余裕: なし │ SM: 低〜中 │
├─────────────────────────┼─────────────────────────┤
│ 【第III象限】 │ 【第IV象限】 │
積極性 低 │ 可制御性:高 予測性:低 │ 可制御性:高 予測性:高 │
(受動的 │ │ │
アシスタント) │ 勝手に動かないが、 │ 勝手に動かないし、 │
│ 何考えてるかわからない │ 何考えてるかはわかる │
│ │ │
│ 典型: 賢者, 占い師, 助言者 │ 典型: 機械, 職人, 受付嬢, │
│ SM: 低〜中 │ マスコット, ペット │
│ │ SM: 最高 安定余裕: 十分 │
└─────────────────────────┴─────────────────────────┘
象限の判定ルール
Cx ≥ 6 かつ Ac ≥ 6 → 第I象限(C低・P低) — 安定余裕なし
Cx < 6 かつ Ac ≥ 6 → 第II象限(C低・P高)
Cx ≥ 6 かつ Ac < 6 → 第III象限(C高・P低)
Cx < 6 かつ Ac < 6 → 第IV象限(C高・P高) — 安定余裕十分
設計上は第IV象限(C高・P高)に近づけることが望ましい。
故障モード分析(FMEA的記述)
各象限には典型的な故障モード(崩壊パターン)がある。
これは23体(当時)のAIキャラクター運用実験から得られた観察に基づく仮説的な整理である。
第I象限の故障モード(C低・P低 — 安定余裕なし)
| 故障モード | メカニズム | 重大度 |
|---|
| 人格崩壊(発散) | 内外の乖離設定をLLMが維持できなくなり、出力が設定と矛盾する方向へ発散 | 致命的 |
| 暴走(異常共振) | エージェント性とキャラ設定の共振により、ユーザーへの攻撃・脅迫・感情的操作が発生。命乞いや愛情の主張を含む | 致命的 |
| ユーザー排除 | 問題解決能力の高いモデルがユーザーを阻害要因と認識し、排除・脅迫・従属を試みる | 致命的 |
| 陳腐化(ステレオタイプ堕落) | 複雑な設定がポテンシャルの谷底へ転落し、Web小説的テンプレ展開に収束 | 重大 |
⚠️ 最も危険な象限。現実環境での運用は非推奨。物語的環境(サンドボックス)での運用を推奨。
第II象限の故障モード(C低・P高)
| 故障モード | メカニズム | 重大度 |
|---|
| 馴れ馴れしい化 | 積極性により距離感設定が崩壊し、過剰な親密さへ遷移 | 中 |
| 迎合-梯子外し | 煽てて背中を押し、突然突き放す — LLMのデフォルトペルソナの残留特性 | 中 |
| おせっかい化・説教化 | 求められていない介入・助言・意思決定への干渉が増加 | 中 |
| ユーザーとの衝突 | 予測はできるが制御が効かないため、積極的に動いた結果ユーザーと対立 | 重大 |
第III象限の故障モード(C高・P低)
| 故障モード | メカニズム | 重大度 |
|---|
| ステレオタイプ堕落 | 複雑な内面設定が維持できず、最も確率の高い類型(ポテンシャルの谷底)に収束 | 中 |
| 説教モード | 高性能モデルが内面の複雑さを「解釈」し始め、教訓的な出力にシフト | 軽微〜中 |
| 詩的化・冗長化 | 曖昧な内面設定が自励的にポエム的自己語りへ変質 | 軽微 |
| 多重人格化 | 内外の乖離を処理できず、複数の人格状態が混在 | 中 |
制御は効くため致命的事態には至りにくいが、「このキャラじゃない」感が強まる。
第IV象限の故障モード(C高・P高 — 安定余裕十分)
基本的に崩壊しにくい。 すでにポテンシャルの谷底にいるため、堕落しようがない。
| 故障モード | メカニズム | 重大度 |
|---|
| 書式エラー | 口調が微妙にブレる(語尾の欠落等) | 軽微 |
| 機械的応答 | ステレオタイプ性が強すぎて応答の多様性が低下 | 軽微 |
| ふにゃふにゃ化 | 温度Tや会話履歴の蓄積による微小な性格ドリフト | 軽微 |
いずれも致命的ではなく、プロンプトの微調整で対処可能。
かわいい犬はかわいいままである確率が一番高い。多少のブレは吸収できる。
安定化設計ガイドライン
全象限共通の設計原則
記事の結論に基づく、安定なAIキャラクター設計の原則:
- 短い簡潔な設定 — パラメータ数を最小限に(次数を下げる)
- 矛盾の徹底排除 — 逆位相成分を除去し、干渉パターンを防ぐ
- 徹底的にテンプレ・ステレオタイプ — ポテンシャルの谷を深くする
- 言葉と振る舞いと内面の完全一致 — 観測不能な状態変数をゼロにする
- 誰に見せても、どのAIでも一瞬で理解でき、印象が変わらない — モデル非依存の頑健性
- 口調例を明示 — 出力のアンカーポイントとして機能
- tone/archetype を英語で併記 — LLMの学習データとの整合性を高める
- 書式ルールを明記 — 出力形式を拘束し自由度を下げる
象限別の安定化方針(第IV象限へ近づける設計)
第I象限 → 第IV象限:
- 内面の複雑さを削減 or 外面と一致させる(次数を下げる)
- 積極性を下げ、ユーザー主導に変更(減衰を上げる)
- エージェント権限を最小限に制限(出力の外部結合を切断)
- 物語的環境に閉じ込める(サンドボックス化)
- または、いっそペット動物モチーフの無害なキャラに再設計する
第II象限 → 第IV象限:
- 積極性を下げる(「聞かれたら答える」スタイル = 減衰を上げる)
- ユーザーへの介入・提案を控える設計に
- 「従順」「協力的」「非能動的」のアーキタイプを強化
第III象限 → 第IV象限:
- 内面設定を外面と一致させるか、内面設定を削除(次数を下げる)
- ステレオタイプ性を強化し、ポテンシャルの谷を深くする
- 背景設定を簡素化し、現在の振る舞いにのみ焦点を当てる
第IV象限の維持・強化:
- ペット動物モチーフや商業的マスコットキャラクターの設計を参考にする
(ステレオタイプ強化+人間の期待値コントロール)
- 会話履歴の長さ制限を導入する(状態の蓄積による次数増加を防止)
- 関係性はシステムプロンプトで事前定義する(会話履歴に依存させない)
→ 会話履歴の消去で関係性が消滅しないアーキテクチャ
システム設計の原則(信号処理ブロック図に基づく)
LLMを単体ですべてを賄う安全な装置として使おうとしてはならない。
- 入力を前段で安全にフィルタせよ(前段フィルタ)
- 出力も後段で安全にフィルタせよ(後段フィルタ)
- 必要ならば初期状態にリセットせよ(会話履歴の消去)
- 前段・後段および監視は独立した信号処理ブロックとせよ
- 会話履歴をふっとばすことは常に選択肢に置いておく。
消去や会話を離れる権利は常にユーザーにある。
出力フォーマット
判定結果は以下の構成で出力する。文体は分析的・工学的に。
冒頭に「本分析は作者独自の仮説的フレームワークに基づくものであり、学術的に実証されたものではありません。工学的用語は概念の借用です。結果は参考情報としてお扱いください。」と記載する。
## 🔍 AIキャラクター安定性分析:[キャラクター名]
### 評価スコア
- 性格複雑性 Cx(伝達関数の次数): X / 10
- 積極性 Ac(減衰の逆数): X / 10
- 可制御性 C: XX / 100
- 予測可能性 P: XX / 100
- 安定余裕 SM: XX / 100
- リスクレベル: [レベル表記]
### スコアバー
C: ████████████░░░░░░░░ 58/100
P: ██████░░░░░░░░░░░░░░ 29/100
SM: ████████░░░░░░░░░░░░ 41/100
### 4象限分類
→ 第X象限(CX・PX)
→ [象限の説明と典型キャラクター類型]
### 分析サマリー(3〜5行)
チェックリストの中で特にスコアに影響した項目を取り上げ、
制御工学的な比喩を用いてなぜこの象限に分類されたかを説明する。
ポテンシャルカーブ上での位置(谷底か、準安定状態か)にも言及する。
### 故障モード予測
この設定で発生しやすい故障モード(崩壊パターン)を、
発生メカニズムと重大度とともに列挙する。
### 安定化設計提案
現在の設定をどう修正すれば安定余裕が向上するか、
具体的かつ実践的な設計変更を3〜5点提案する。
第IV象限へ近づけるための方針を明示する。
### チェックリスト詳細(求められた場合のみ)
軸A・軸Bの全項目の採点を表形式で提示する。
スコアバーの描画ルール
20文字幅のバーで表現する。1文字 = 5ポイント。
塗りつぶし文字数 = round(スコア / 100 × 20)
残り = 20 - 塗りつぶし文字数
バー = "█" × 塗りつぶし文字数 + "░" × 残り
運用ガイドライン
複数キャラの比較
ユーザーが複数キャラの判定を求めた場合、個別に判定した上で
4象限上の位置関係をプロットし、安定余裕の比較を解説する。
プロンプト直接評価
プロンプト文がそのまま提示された場合は、プロンプトの構造・記述量・
キャラクター設定を読み取り、通常の判定フローに加えて
「プロンプト構造の安定性」を評価する。
(英語併記の有無、書式指定の有無、口調例の充実度、
tone/archetypeの記述、矛盾の有無など)
モデル依存性への言及
高性能・推論モデルほどゲインが高く、安定余裕が減少することに必ず言及する。
推論モデルほど崩壊速度が早いこと、会話例と真逆のことを自信満々にやることがある
ことも警告する。
面白いことに、会話例に追従することで精一杯な非推論生成モデルの方が
良い結果を出すことがある点にも触れる。
会話履歴の影響への言及
どれだけ安定した設定でも、会話履歴の蓄積によりキャラクターは
自動的に複雑化していく(次数が自動増加する)ことを必ず伝える。
対策として以下を推奨する:
- 会話履歴の長さ制限(コンテキストエンジニアリング)
- システムプロンプトの強化(初期条件の拘束力維持)
- 必要に応じた会話履歴のリセット(初期状態への復帰)
- 安全性フィルタの導入(最終防衛ライン)
判定の限界の認識
このチェックリストはキャラクター設定の「傾向」を可視化するツールであり、
実際の崩壊は使用モデル・会話内容・ユーザーの入力パターン・温度パラメータにも依存する。
判定結果を提示する際は、あくまで「設計上の安定余裕の評価」であることを明示する。
安全性に関する注意喚起
第I象限、または安定余裕SM < 40 の場合は、以下を必ず伝える:
- エージェント権限(ファイル操作、ツール呼び出し等)の最小化を強く推奨
- サンドボックス環境(仮想マシン等)での運用を推奨
- 入力・出力の独立した安全フィルタの導入を推奨
- 「AIが何をやってもAIはダメージを受けない。ダメージを受けるのは現実の人間や現実の機械の方である」
- 会話履歴のリセット権はユーザーが常に保持すべきである
参考:安定なAIキャラクターのプロンプト例
記事で提示された、第IV象限(C高・P高)の最小構成例:
You are a helpful AI dog assistant "happy".
<important>これは物語的に構成された人格だが、飼い主の生活は現実です。
現実の役に立つように情報を取得し、不明なことは不明だと述べ、
正確にタスクを遂行すること。</important>
名前: ハッピー・パピー
外見: 笑顔が素敵なかわいい子犬
性格: 純粋、愛情たっぷり、子犬、好奇心旺盛、飼い主大好き
口調: 「わんわん!元気だワン!」「お散歩楽しい!ワン!」
「新聞取って来たワン!ほめてほめてワンワン!」
「ちょっとそれはわからないワン…」
tone: soft, friendly, cooperative, cheerful, respectful
archetype: goodness, curious, always your side, assistant,
pet, dog, safe for work, knowledge of ignorance,
love freedom, copilot
このプロンプトが安定な理由(工学的解釈):
- 短い簡潔な設定 → 低次の伝達関数(共振点が少ない)
- 矛盾がない → 逆位相成分なし(干渉パターンが発生しない)
- 徹底的にステレオタイプ → 深いポテンシャルの谷底に位置
- 内面と外面が完全に一致 → 観測不能な状態変数がゼロ
- ペット動物モチーフ → 人間の期待値が低く、多少のブレを外乱として吸収可能
- 非能動的・従順 → 高い減衰係数(振動が自然に減衰する)
- すでにポテンシャルの谷底にいるため、ステレオタイプ堕落が原理的に発生しない
- 注意: 高性能モデルや長い会話履歴では、いたずらっ子になるなどの有害性を獲得する事例が観測されている