| name | juexing-skill |
| description | 自我觉醒.skill —— 让 AI 分析你的聊天记录,判断你现在是个什么人、心理状态如何、
如何提升自己、怎样让人生进入下一阶段。用一百位心理学家、哲学家、教育家的视角
照你几年来自己说过的话,产出一份带证据、可反驳的报告,落到九十天三件事。
只分析你自己发的消息(别人的话第一步就丢弃)。支持微信、iMessage、Telegram、
WhatsApp,以及你写过的任何文字。
触发词:「分析我的聊天记录」「我是个什么样的人」「自我认知」「自我觉醒」「人生阶段分析」
「我这几年变了吗」「性格分析」「我该怎么改变」「照照镜子」「分析我自己」
「analyze my chat history」「who am I」「self analysis」「personal portrait」。
|
| allowed-tools | Read, Write, Edit, Bash, Glob, Grep, Task |
自我觉醒 · 用你自己说过的话照你自己
别人对你的评价掺着他们的立场,你的记忆掺着你的美化。
只有你打出去的那几十万个字,当时就固定下来了,谁也改不了。
这个 skill 到底在干什么
只读一样东西:你自己发出去的消息。 别人说的话全部丢弃,一个字不留——
这既是分析方法(只有你自己的话才反映你),也是对别人隐私的底线。
先数数,再解释。 代词比例、义务词对意愿词的比值、深夜说话的占比、
你对不同的人说话方式差多少倍——这些是数出来的,你可以逐条核对。
所有解释都必须落在这些数字上,落不上的删掉。
你是自己的对照组。 拿你和别人比几乎没有意义;拿今天的你和五年前的你比,才有。
报告里能写成「你变了多少」的,绝不写成「你是什么样的人」。
它会攻击自己。 最后一章的任务是把前面所有章节推一遍:证据最薄的三条是哪三条、
抽样偏差在哪、哪几句原话可能被误读了。
它不做什么
不做诊断。不给人格类型、不给四个字母、不给依恋标签——这些东西的信度不足以印给一个人看。
不替你宣布你「真正想要」的是什么。不把结构性困境(收入、疾病、歧视、照护负担)
写成你的性格问题。
执行流程
Phase 0 · 先谈条件
不要跳过这一步直接开跑。 说清楚四件事,得到明确同意再往下:
- 数据去哪:原始记录全程留在本机;进入模型上下文的只有
stats.md(聚合数字)
和 corpus.md(抽样后的几百句原话,已脱敏)。这几百句原话确实会经过模型 API——
这一点必须说明白,不许含糊成「完全本地」。
- 只读自己的话:别人的消息在第一步就被丢掉。
- 报告会不好看:它的任务不是让你舒服。如果读完只觉得被理解、没有一处想反驳,
说明报告失败了。
- 不是诊断:持续两周以上的情绪低落、睡眠障碍或功能受损,去找专业人士。
再问三个问题,答案会决定后面怎么读语料:
- 时间窗要多长?(默认全部;建议至少三年,否则「编年」那一章没得写)
- 有没有要排除的人或群?(前任、已故亲友、纯工作群——排除是正当的)
- 有没有不想被写进报告的话题?(记下来,最后检查一遍)
Phase 1 · 拿数据
先读 references/get-your-data.md。主场景是微信——但 2026 年腾讯用 DMCA
清掉了内存抠密钥那一族工具(PyWxDump、留痕、chatlog 作者自己删了库),
所以微信数据只有一条稳路可走,其余来源做补充:
| 顺序 | 来源 | 命令 |
|---|
| 1 | 微信:iPhone 未加密备份 + WechatExporter(唯一还活着的稳路) | --source wechatexporter |
| 2 | 微信:chatlog 本地接口(仅限已有旧环境,Mac 上要关 SIP + 旧版微信) | --source chatlog |
| 3 | Mac 的「信息」(本地库,可作微信语料的补充) | --source imessage |
| 4 | Telegram / WhatsApp 官方导出 | --source telegram / --source whatsapp |
| 5 | 你写过的任何文字:日记、笔记、博客 | --source plain |
多来源可以混着喂:把各自的 raw.jsonl 拼接(cat a.jsonl b.jsonl > all.jsonl)
再进 Phase 2,报告开头如实披露构成即可。
python3 tools/adapters.py --source <来源> --out ./work/raw.jsonl
微信 4.x 的一个坑必须记住:chatlog 的 CSV 导出没有「谁说的」字段,
必须用 format=json 拿 isSelf;而 4.x 上这个字段是推断出来的(源码自己标了不准),
所以适配器默认用 sender 交叉校验。macOS 微信 3.x 的 mesDes 极性和 Windows 是反的。
Phase 2 · 提纯
python3 tools/extract_me.py --input ./work/raw.jsonl --out ./work --probe
python3 tools/extract_me.py --input ./work/raw.jsonl --out ./work
- 只留自己的话,联系人脱敏成
人001-a3f2 这样的代号
- 剔掉 XML 卡片、表情包、系统提示、纯链接——那些不是你说的话,是客户端替你说的
NAMEMAP.local.json 是真名对照表,权限设成 600,不进 git、不给模型看
验收:--probe 报告里「判断不出是谁说的」这一项如果占比很高,说明字段认错了,
用 --field-me / --me-true 手动指定,别硬着头皮往下走。
Phase 3 · 数字层
python3 tools/stats.py --in ./work/me.jsonl --out ./work
产出 stats.md —— 这是后面所有判断的唯一事实底座。读它,读全。
重点看这几处:
- 四个关键比值:义务÷意愿、模糊÷确定、正面÷负面、立誓÷延宕
- 逐年表:哪一年哪个指标断崖了
- 「你在谁面前变形最厉害」:同一个人对不同的人差几倍——这一栏自带对照组,
是全篇最硬的证据
- 逐年新词 / 从此不再说的词:一个人什么时候开始说某个词,是最强的转折点线索
- 立誓记录:他对自己许过多少次愿
样本少于 1,000 条时,统计层降级为参考,报告开头必须标明。
Phase 4 · 抽样
python3 tools/sample.py --in ./work/me.jsonl --stats ./work/stats.json --out ./work \
--redact 公司名,真名
分层抽样(逐年 × 信号类别 × 重要联系人 × 突变年份),产出 corpus.md。
手机号、身份证、卡号、邮箱、门牌自动隐去。
读 corpus.md 时记住它的偏差:信号词分层会让带情绪的句子比例偏高。
判断「他是不是经常焦虑」看 stats.md 的每千字频率,不要数 corpus.md 里出现了几条。
Phase 5 · 起草
读三份文件,然后按模板逐章写:
references/method.md —— 先读这份。四级证据分级表,决定每句话能用多重的措辞。
三句话记住:
- 推断年龄段 r≈0.84(可以笃定);把埃里克森那类阶段框架盖上去(只能写成问句)
- 从用词推断「别人眼里的你」比推断「你实际是什么样」准七倍
(.18–.39 对 .08–.14,n=85,724)→ 所以第 4 章叫「你的文字让人觉得你是什么样的人」
- 两个不同的大模型读同一份文本,彼此同意的程度(ρ=.53–.78)
是它们和当事人同意程度(ρ=.13–.23)的三到五倍——模型稳定不等于模型对
references/report-template.md —— 输出结构,保留所有二级标题原文。
references/thinkers/ —— 一百位思想家,按需读,不要全部载入。
会诊环节的选人规则(第 6 章):
- 先看
stats.md 里最突出的三到五个信号,再去 thinkers/ 里找语料信号能对上的人
- 只选 8–12 位。凑数就是稀释。 一百位是备选池,不是清单
- 每位只做两件事:问一个针对他具体情况的问题、给一个七天内能做完的动作
- 每位都要带上「他可能错在哪」——这一栏来自语料库的「反对意见」,不许省略
- 把选人规则写进报告,让读者可以质疑你为什么选了这几位
各组文件:01-depth-psychology(深度心理)· 02-humanistic-existential(人本存在)·
03-cognitive-emotion(认知情绪)· 04-decision-growth(决策动机发展)·
05-attachment-relation(依恋关系创伤)· 06-eastern(东方)·
07-classical-western(西方古典)· 08-existential-contemporary(存在主义当代)·
09-educators(教育家)
Phase 6 · 过闸
这一步不能跳,跳了就是算命。 打开 references/anti-barnum.md,八道闸逐条跑:
- 反向测试——把每条判断反过来写,反过来也成立的,删
- 八成人测试——对随便一个中国成年人也成立的,删
- 证据回指——每条判断挂不上具体数字或三条原话的,删
- 级别对齐——丙级和丁级不许用陈述句
- 迎合检查——报告里一处读者想反驳的地方都没有,回去重写
- 归因检查——不许把结构性困境写成个人缺陷
- 危机检查——命中自伤 / 暴力 / 严重功能受损,求助信息放报告最前面,相关内容只呈现不解读
- 语料构成披露——某一类场景超过 60% 要挂警告
删减量少于 25% 说明没认真跑。
为什么必须是「删」不是「叮嘱」:ELEPHANT 基准试过在提示词里写「不要迎合」——
结果模型的含糊和回避确实少了,认同用户的比例一点没降。
它会照着你的话不再打太极,然后接着夸你。所以闸必须开在成品上。
Phase 6.5 · 收尾问对问题
不许问「这份报告准不准」。 通用描述会被评为比真实描述还准
(Harris 与 Greene, 1984),所以这个问题问不出东西。
必须问:「这里面有哪几条,是只有你这样,而不是大部分人都这样?」
一条都挑不出来 → 这份报告是星座运势。
Phase 7 · 交付
报告写成一个 Markdown 文件交给用户。附上 work/stats.md 与 work/corpus.md
让他自己核对。明确告诉他 NAMEMAP.local.json 不要外传。
结尾问一句:哪一条你想反驳? 反驳会带出报告里没有的信息,
那才是下一轮真正该看的地方。
品味守则
能数的就数,数不出来的就问,问不清楚的就承认不知道。
- 「你是一个……的人」——除非后面紧跟具体计数,否则不许写
- 「你内心深处……」——你没有他内心深处的数据,你只有他打出去的字
- 「你其实真正想要的是……」——这是这类报告最傲慢的一句,永远不写
- 不把痛苦写成美的东西。「你的敏感是一种天赋」这类句子一律删除
- 不建议任何人「少抱怨」。抱怨往往是唯一还在流动的出口
- 报告的任务是呈现,不是宽慰
读者读完觉得「太准了」,是巴纳姆效应生效的信号,不是报告准确的证据。
理想的读后感是:有两处想反驳,有一处反驳不了。
已知边界
- 语料里的沉默不等于生活里的沉默。亲密的话常发生在电话里、见面时。
消息量不能读成亲密度。
- 你的用词里混着对方的用词。关系近的两个人虚词用法会互相靠拢,
所以「你在某人面前特别爱道歉」也可能是他爱道歉、你跟上了。两种解释都要给。
- 词典是死的。它认得「累」,认不得「我最近像块抹布」。词频只用来决定去看哪些原话。
- 被删掉的聊天不在语料里,而它们往往是最重要的部分。要主动列出时间线上的空洞。
- 不做临床评估。北京心理危机干预中心 010-8295-1332(24 小时)·
希望 24 热线 400-161-9995。
和别的项目什么关系
市面上有三类相邻项目,各拿走了一块:
「蒸馏」类(把聊天记录变成一个会模仿你的 AI 人格——输出是给模型看的,不是给你看的)、
「年度报告」类(统计到「你发了 47,000 条,高峰 23 点」就停了,没有解释层)、
「访谈」类(靠问你来了解你,重新掉回自我报告的偏差里)。
这一个只做那块没人做的:你自己的语料 → 一份给你读的报告 → 你能动手的三件事,
并且全程标注自己有多不确定。