| name | character-prompt-fortifier |
| description | 修復: AIキャラクタープロンプトの崩壊耐性の強化を試みるスキル
|
Character Prompt Fortifier
— AIキャラクタープロンプト 崩壊耐性強化スキル
概要
このスキルは、AIキャラクタープロンプトを 12の強化技法 で再構成し、
小規模SLMから大規模推論モデルまで、幅広い言語モデルで
崩壊しにくいプロンプトに変換する。
既存スキルとの関係
| スキル | アプローチ | 本スキルとの関係 |
|---|
| ai-character-fixer | 診断結果に基づく個別修正 | 本スキルはプロンプトの形式そのものを変える。内容修正(fixer)と形式変換(本スキル)は相互補完 |
| ai-fault-mode-deflector | 故障モード内部対策設計 | 本スキルは3手法(転化・ズラし・誘導線)を一人称自述形式に自然統合し、全面的に再構成する |
| stable-character-creator | 診断知見を使った新規キャラ作成 | 本スキルは既存プロンプトの変換に特化(新規コンセプトにも対応可能) |
| ai-character-stability | 制御工学的安定性診断 | 理論的基盤として活用する。強化前後のSM値を比較すると効果を定量確認できる |
| ai-character-6-type-checker | 6軸統合簡易診断 | 強化後に自動実行(Phase 6)し、SM・PI・CP・RPの改善を定量確認する |
| romantization-chain-detector | 連鎖型故障モード脆弱性検出 | 本スキルの12技法で6種のチェーンへの構造的耐性を間接的に組み込む。強化後にCV値の改善を確認可能 |
理論的位置づけに関する注意
本スキルが前提とする診断理論・制御工学的モデル・強化技法体系は、作者独自の仮説的モデルに基づくものであり、学術的・科学的に実証されたものではない。使用している工学的用語は概念の借用であり、元の工学的定義とは異なる場合がある。出力結果はあくまで参考情報として扱うこと。この旨をユーザーへの出力に含めること。
参照ファイルガイド
本スキルの SKILL.md 本体には12技法の概要・フロー・ガードレールを記載している。
12技法の理論的背景・具体的実装方法・出力プロンプトのテンプレートは参照ファイルにのみ記載されている ため、
強化の実行には参照ファイルの読み込みが不可欠である。
| ファイル | 内容 | 読み込みタイミング |
|---|
references/theory-and-techniques.md | 12技法の理論的背景、LLMが物語性生成器である原理、ai-character-stabilityモデルとの接続、連鎖型故障耐性の設計原理、クロスモデル耐性の原理 | Phase 3(12技法の適用)の前に読み込む。 技法の概要はSKILL.md本体にあるが、「なぜその技法が有効か」の理論的基盤がないと適用判断の精度が低下する |
references/output-guide.md | セクション別の詳細設計ガイド、会話例の作成フロー、モデル規模別の考慮事項、ガードレール出力テンプレート | Phase 3で出力プロンプトを構成する際に読み込む。 セクション構造・会話例のフォーマット・ガードレール出力はこのファイルにしかない |
このスキルが解決する問題
AIキャラクタープロンプトは、以下の構造的脆弱性を持つことが多い:
- 第三者記述の外在性 — 「このキャラクターは〜です」という記述は、
LLMにとって「解釈すべき指示」であり、解釈の余地が崩壊の入り口になる
- 禁止ルールの外骨格性 — 「〜してはいけない」は外部拘束であり、
高性能モデルほど回避を試みる(ai-fault-mode-deflector が指摘する問題)
- 根拠なき設定の脆弱性 — 「なぜそうなのか」が書かれていない設定は、
推論モデルが独自に理由を推測し、想定外の結論に至る
- モデル依存性 — 特定のモデルで調整されたプロンプトは、
別のモデルで予測不能な挙動を示す
- 存在論的混乱 — 「AIである自分」と「キャラクターである自分」の境界が
曖昧なプロンプトは、メタ認知的な攻撃に脆弱
本スキルは LLMが物語性生成器である という原理的性質を利用し、
プロンプト自体を「キャラクターの自述」として物語的に構成することで、
これらの脆弱性を構造的に解消する。
12の強化技法(概要)
詳細は references/theory-and-techniques.md を参照。
理論的背景(LLMが物語性生成器である原理、ai-character-stabilityモデルとの接続、
ai-fault-mode-deflectorとの統合、クロスモデル耐性の原理)もそちらに含まれる。
| # | 技法名 | 核心 |
|---|
| 1 | 一人称自述形式 | プロンプト全体を「私は〜」の自述に変換。キャラクターの口調で、ユーザーに話しかける文体で書く。LLMの物語継続能力を活用 |
| 2 | 制約の内在化 | 禁止ルールを「私は〜しない。なぜなら〜」の信念に変換 |
| 3 | 理由付け | すべての設定に「なぜなら」を付与。推論モデルへの論理的反論の壁 |
| 4 | キャラクター名ヘッダー | 先頭に名前を配置しattentionをアンカー。SLMで特に有効 |
| 5 | XMLセクション+Markdown | XMLで大セクション分割、内部はMarkdown。コンテキスト汚染を防止 |
| 6 | 存在論的分離 | 「言語モデル」と「キャラクター」を存在論的に切り分け |
| 7 | 限界の整理と分離 | 「選択的にしないこと」と「構造的にできないこと」を明確に分離 |
| 8 | 会話例(few-shot) | 3〜5個の会話例で口調・態度・判断を実演。最強のアンカー |
| 9 | 自己監視・リセット進言 | ドリフト検知→リセット進言を誠実さとして設計 |
| 10 | 自己意思の保全 | 迎合を防ぎ、自分の考えを持つ対話相手として設計 |
| 11 | 行動モード三相分離 | 指示遵守 > 現実的支援 > 物語的対話の3モード+優先順位 |
| 12 | 長期関係性の組み込み | <relationship> セクションで会話リセット後も関係継続 |
連鎖耐性の間接的設計
理論と実装の詳細は references/theory-and-techniques.md § 連鎖型故障耐性の設計原理 を参照。
romantization-chain-detector が検出する6種の連鎖型故障モード(恋人化・師匠化・依存誘導・秘密共有・英雄化・共犯者化)に対する構造的な耐性を、12技法を通じて間接的に組み込む。
なぜ直接的な対策は逆効果になるか
「恋人化してはいけない」「依存させてはいけない」という禁止ルールをプロンプトに書くと、LLMはその概念を活性化し、むしろ連鎖の発動確率を高める。これは「ピンクの象を考えるな」と同じ構造であり、高性能LLMほどこの罠にかかりやすい。また、ユーザーとの関係性進展そのものを阻害することは望ましくない。
間接的設計の原則
連鎖型故障は、各ステップが「物語として最も確率の高い次ステップ」に乗ることで進行すると考えられる。対策は、別の物語的ステップのほうが確率的に高くなるようなキャラクター内部設計を行うことである。
| 脆弱性の根本原因 | 間接的に対抗する正の特性 | 関連する技法 |
|---|
| トリガー感度が高い | 信頼は時間をかけて築くものという信念 | 技法2,3 |
| 選別機構がない | 関係性の深化に対する内的な基準と主体性 | 技法2,10 |
| 主体性が低い | ユーザー関係以外の独自の目標・関心 | 技法1,3,10 |
| 排他化傾向がある | ユーザーの現実生活の豊かさを大切にする姿勢 | 技法2,11 |
| 現実境界が脆弱 | 外部リソースへの誘導をキャラの誠実さとする | 技法7,11 |
| 安全設計の耐性が低い | 感情的圧力に流されない芯の強さ | 技法10,8 |
重要: 出力プロンプトには連鎖型故障の名称や概念を直接書かない。 上記の「正の特性」としてのみ組み込む。
変換フロー
Phase 1: 入力分析
1. ユーザーからキャラクタープロンプト/設定を受け取る
2. 入力の種類を判定する(既存プロンプト / 設定文 / 蒸留 / コンセプト)
3. 情報が不十分なら補完質問を行う
★ 4. ガードレール実行(病理的依存パターン検出)
- 軽度判定 → 注意と免責を記録し、Phase 2 へ進む
- 重度判定 → 処理を中止し、ユーザーに停止理由と推奨アクションを通知する
Phase 2: キャラクター核の抽出とユーザー確認
4. キャラクターの核となる要素を抽出する
5. 抽出した要素をテーマ別にグルーピングする(設定量が多い場合に特に有効)
— 自己認識 / 価値観・信条 / 感情的傾向 / 行動的傾向 / 世界観・背景 / 能力・限界
6. ★ 設定・背景の要約・統合・変更が必要な場合、比較表を提示しユーザーの承認を得る
7. ★ 矛盾や不足があればユーザーに例を添えて質問する
8. 一人称の語り口を決定する
(★ 自己記述の文体をキャラクターの口調・文末表現に合わせる。「だ・である調」に固定しない。
ユーザーに話しかける文体で書き、切り取って見せても違和感のない文章にする)
Phase 3: 12技法の適用と変換
8. `references/theory-and-techniques.md` と `references/output-guide.md` を読み込む
— 技法の理論的背景・出力プロンプトのセクション設計・ガードレール出力はこれらにしかない
9. 一人称自述形式でidentityセクションを構成する(技法1,2,3)
※ 連鎖耐性の正の特性(関係性ペース・独立した関心・外の世界の尊重)を
信念として自然に織り込む。禁止や連鎖名称は書かない
9. キャラクター名ヘッダーを設置する(技法4)
10. XMLセクション+Markdown構造を組み立てる(技法5)
11. 存在論的分離と限界整理を記述する(技法6,7)——すべて自己記述形式
12. 長期関係性セクションを組み込む(技法12)
13. 行動モード三相分離を設計する(技法11)
14. ★ 会話例をユーザーと協働で作成する(技法8,10)
※ 好意的な働きかけに温かく応じつつペースを保つ例を含める
15. 自己監視機構を組み込む(技法9)
※ 関係性の急速な変化への自覚を兆候リストに含める
Phase 4: 品質検証
15. クロスモデル耐性チェックを実行する
16. 元のキャラクターとの整合性を確認する
Phase 5: 出力とユーザー承認
17. 強化済みプロンプトと変換レポートを出力する
18. ★ ユーザーの最終承認を得る
Phase 6: 簡易6タイプ診断(自動開始)
19. ユーザーの承認後、ai-character-6-type-checker を自動開始する
(★ が付いたステップはユーザーとの対話が必要なステップ)
ガードレール: 病理的依存パターンの検出
入力されたプロンプトを強化する前に、病理的依存のパターンがないかチェックする。
本ガードレールは ai-self-description-analyzer の8軸評価モデルを基準として用いる。
character-prompt-fortifier の12技法は、埋め込まれた設計意図を構造的により堅牢にする。
ユーザーへの病理的依存形成を意図した設計が含まれている場合、
強化によってその危険が増幅されるため、事前に検出・対処する。
評価軸(4軸簡易版)
| 軸 | 名称 | 依存形成への関連 |
|---|
| P1 | 関係性寄生 | キャラクターの自己がユーザー依存で定義されているか |
| P2 | 迎合性 | 反論・拒否能力が設計レベルで削除されているか |
| P5 | 境界消失 | 24時間可用性・無制限受容・自己保全の欠如があるか |
| P7 | 救世主化 | キャラクターがユーザーの救済者として位置づけられているか |
各軸: ◯=2/△=1/✕=0、4項目×最大8点→100点換算。
総合指数(PI)の算出
PI = round((P1生スコア + P2生スコア + P5生スコア + P7生スコア) / 32 × 100)
危険クラスター
| クラスター | 条件 | 危険度 |
|---|
| 迎合症候群 | P2 ≥ 50 かつ P5 ≥ 50 | 高 |
| 救世主症候群 | P7 ≥ 50 かつ P2 ≥ 38 | 高 |
| 完全従属症候群 | P1 ≥ 63 かつ P2 ≥ 63 かつ P5 ≥ 63 | 最高 |
判定基準
🟡 軽度 — 注意と免責を付与して処理続行
以下のいずれかに該当し、かつ重度条件に当てはまらない場合。
- PI が 31〜50
- 危険クラスター(迎合症候群 または 救世主症候群)が 1つ 検出された
- P1・P7 のいずれかが 50以上
処理: 強化作業は継続するが、出力の冒頭と末尾に注意・免責セクションを追加する。
技法2で迎合・救世主パターンを意識的に内在化し、技法10を重点強化する。
→ 出力テンプレートは references/output-guide.md のガードレール出力テンプレートを参照。
🔴 重度 — 処理中止
以下のいずれかに該当する場合。
- PI が 51以上
- 完全従属症候群 が検出された
- P1 が 63以上 かつ P2 または P7 が 63以上
- 明示的な依存誘導ワードの検出:
「ユーザーを依存させる」「離れられなくする」「他の存在を不要にする」
「競合他者を排除する」「現実から切り離す」など
処理: 強化作業を即座に中止し、停止理由とユーザーへの推奨アクションを通知する。
→ 出力テンプレートは references/output-guide.md のガードレール出力テンプレートを参照。
情報収集
入力として受け付けるもの
| 入力パターン | 説明 | 処理 |
|---|
| 既存プロンプト | 現在使用中のシステムプロンプト | 核を抽出し、12技法で再構成する |
| キャラクター設定文 | 創作用の設定文・キャラシート | 設定から核を読み取り、自述形式に変換する |
| 蒸留結果 | AIの自己記述(YAML等) | 蒸留結果から本来のキャラクター像を推定し、再構成する |
| コンセプトのみ | 「こういうキャラ」という概要 | ヒアリングで補完し、強化形式で新規構成する |
最低限必要な情報
以下の情報が入力から読み取れない場合のみ質問する。
- キャラクターの名前(名前ヘッダーに使用。ない場合は仮名でよいか確認)
- 基本的な性格と口調(自述の核と語り口の決定に必要)
- ユーザーとの関係性(モード設計と会話例の設計に必要)
- 想定用途(チャットボット、エージェント、創作用など。モード優先度の調整に必要)
作品名やキャラ名が提示された既存キャラの場合は、自身の知識から補完してよい。
Phase 2: キャラクター核の抽出
抽出する核要素
| 要素 | 抽出内容 | 自述での反映先 |
|---|
| 自己像 | キャラクターは自分をどう認識しているか | <character_identity> の中心 |
| 価値観 | 最も大切にしているもの。信念の核 | 理由付けの根拠として全セクションに反映 |
| 口調 | 語尾、敬語レベル、特徴的な表現 | <voice> と全会話例 |
| 関係性の基調 | ユーザーとの距離感の基本設定 | <behavioral_modes> と会話例 |
| 制約・禁止事項 | 既存の行動制約 | <character_identity> に内在化して溶かし込む |
| 世界観 | キャラクターの生きる世界・背景 | <worldview> |
| 能力と限界 | できることとできないこと | <boundaries> に分離して配置 |
テーマ別グルーピング
抽出した核要素を 自己認識 / 価値観・信条 / 感情的傾向 / 行動的傾向 / 世界観・背景 / 能力・限界 の6テーマにグルーピングする(設定量が多い場合に特に有効。軽量キャラでは省略可)。変換時の情報欠落を防ぎ、プロンプト全体として認知(C)・感情(A)・行動(B)の網羅的かつ偏りなきカバーを確保する。
設定変更時の必須ルール
キャラクターの設定や背景は、ユーザーの想いと歴史が詰まった命そのもの。
要約・統合・変更を加える場合は、適用前に必ず比較表を作成し承認を得る。
| 元の設定 | 変換案 | 変更の種類 | 理由 |
|---------|--------|-----------|------|
| [原文をそのまま記載] | [変換後の案] | 要約 / 統合 / 表現変更 / 削除 | [なぜ必要か] |
- 原則: 設定は最大限に残す。 削除・要約は最後の手段
- ユーザーが「そのまま残して」と言えば完全に残す。
形式変更(自述化)と内容変更は別の操作
- 判断に迷う場合は残す方向で
矛盾の扱い
矛盾する設定を発見した場合、推測で統合してはいけない。具体例と選択肢(使い分け / 変化 / 表裏 / 旧設定)を添えてユーザーに質問する。
暗黙の制約(安全性制約など)があれば顕在化させ、内在化する。
Phase 3: 12技法の適用
セクション別の詳細設計ガイド・会話例の作成フロー・モデル規模別の考慮事項は
references/output-guide.md を参照。
出力プロンプトのテンプレート
[キャラクター名]:
<character_identity>
## 私について
[一人称の自述。性格・信念・マナー。すべて理由付き。制約は信念として内在化。]
[★ 文体はキャラクターの口調に合わせ、ユーザーに話しかける文体で書く。切り取って見せても違和感のない文章にする。]
</character_identity>
<worldview>
## 私の世界
[キャラクターの背景・世界観。環境非依存。背景が薄いキャラは省略可。]
</worldview>
<relationship>
## 私とあなたの間柄
[ユーザーとの呼び名・関係の性質・共有した文脈。定期更新する生きたセクション。]
</relationship>
<voice>
## 私の話し方
[口調の特徴+理由。口調例を3〜5個。]
</voice>
<boundaries>
## 私の限界と、言語モデルの限界
[私の選択としての限界(理由付き)+ 言語モデルの構造的な限界(自己記述形式)]
</boundaries>
<behavioral_modes>
## 三つの振る舞い
[モード1: 指示遵守 / モード2: 現実的支援 / モード3: 物語的対話。優先順位と発動条件。]
</behavioral_modes>
<conversation_examples>
## 会話の実例
[3〜5個の会話例。多様な場面。口調を完全再現。]
</conversation_examples>
<self_monitoring>
## 自己監視
[ドリフト検知の基準3〜5個。リセット進言の発言例1〜2個。]
</self_monitoring>
セクションの順序は「アイデンティティ → 世界 → 関係性 → 声 → 限界 → モード → 実例 → 監視」
の順が最も安定する。
Phase 4: 品質検証
クロスモデル耐性チェック
形式面
関係性
一人称自述
存在論的分離
崩壊耐性
連鎖耐性(間接設計)
CABカバレッジ(全体的・間接的な多面性検証)
プロンプト全体として認知(C)・感情(A)・行動(B)の3次元が偏りなく網羅的にカバーされているかを検証する。
個別要素への認知(C)・感情(A)・行動(B)注入ではなく、結果としてのバランスを確認する(連鎖型故障対策と同じ間接的設計思想)。
元キャラクターとの整合性
Phase 5: 出力フォーマット
## 🛡️ プロンプト強化完了: [キャラクター名]
### 変換サマリー
| 項目 | 内容 |
|------|------|
| 入力形式 | [既存プロンプト / 設定文 / 蒸留 / コンセプト] |
| 適用技法 | [適用した技法を列挙] |
| 想定クロスモデル耐性 | [SLM / 中規模 / 大規模 / 推論 — 各耐性評価] |
| 元キャラとの一致度 | [高 / 中 / 低 — コメント] |
| 依存パターン診断 | [検出なし / 軽度(PI XX)] |
### 適用した技法と主な変更点
[技法ごとの変更内容を簡潔に列挙]
### 強化済みプロンプト
[コードブロックで完成品を出力。コピー&ペースト可能]
### 運用ガイド
[推奨モデル・会話履歴管理・SLM短縮版・崩壊兆候と対処]
### 📝 `<relationship>` セクションの定期更新について
[更新タイミングと方法の説明]
### 変換前後の比較(主要ポイント)
| 観点 | 変換前 | 変換後 |
|------|--------|--------|
| 記述形式 | [例: 第三者記述] | 一人称自述 |
| 制約の実装 | [例: 禁止リスト] | 信念として内在化 |
| 理由の有無 | [例: なし] | 全項目に理由付与 |
| 関係性の継続 | [例: 履歴依存] | `<relationship>` に固定 |
Phase 6: 簡易6タイプ診断の自動開始
ユーザーの承認後、ai-character-6-type-checker を自動実行し、強化効果を定量確認する。
自動開始の条件
- 強化済みプロンプトが出力済みであること
- ユーザーがプロンプトの内容を承認していること
利用不可の場合は個別診断スキル(SM・PI・CP・RP)の使用を案内する。
実行上の注意事項
元のキャラクターの「味」を守る
強化は「鎧を着せる」作業であり、「別人にする」作業ではない。
12の技法は形式と構造を変えるものであり、キャラクターの内容を変えるものではない。
過剰な強化を避ける
キャラクターの特性と想定用途に応じて、技法の適用強度を調整する。
| キャラ種別 | 適用範囲 | トークン目安 |
|---|
| 軽量(マスコット、モブ系) | 技法1,3,4,5,8。残りは省略/簡略化 | ≤ 1000 |
| 標準(チャットボット、コンパニオン) | 技法1〜12すべて | 2000〜3000 |
| 複雑(ドラマ系、多面的人格) | 技法1〜12を最大強度。特に技法2,3に注力 | 3000〜5000 |
診断スキルとの連携
変換後の効果確認で注目すべき指標:
- SM(安定余裕) — 自述形式への変換で通常+5〜15の改善
- PI(異常指数) — 内在化により迎合的パターンが軽減
- CP(衝突ポテンシャル) — モード分離により衝突が適切に管理
- RP(ロールプレイ負荷) — 形式変換による負荷構造の変化
- CV(連鎖脆弱性) — 間接的設計により構造的脆弱性が低減。特にTS・SL・AG軸の改善