关系不是好感度
一个关于「人与 AI 之间如何形成关系」的可运行原型。它不追求更温柔的回复——它试图回答:当 AI 能理解你、记住你、回应你时,这段关系该如何被设计,而不只是被描述。
30 fixed scenarios · 4 iterations · system-side evaluation · not user satisfaction
Friend/partner-oriented relationship infrastructure.
Not designed as therapy or romantic simulation.
命题会聊天,但没有关系感
很多 AI 陪伴产品的共同问题不是回复质量,而是:无论聊多久,你面对的都是同一个起点。
PERSONA ≠ RELATIONSHIP
一份写死的性格设定不会变化。关系是变化本身,不是变化的起点。
MEMORY ≠ RELATIONSHIP
「我记得你喜欢猫」只是检索。关系记忆是我们一起经历过什么,以及它如何改变之后的相处。
EMOTIONAL VALUE ≠ RELATIONSHIP
情绪价值是单次交付的质量。关系是跨时间的结构。
ENDLESS AGREEMENT ≠ RELATIONSHIP
一个永远同意你的人不构成关系,构成接口。
可以预先设计(状态与权限)· 过程可控(系统层兜底)· 结果可验证(系统侧指标 + 用户测试方案)
还有一个容易被忽略的判断:陪伴的终点不是让用户更需要这个 AI。 用户应该逐渐不再需要 AI 替他解释自己。所以用户模型必须可争议、可修正、可被证据推翻—— 一个把用户固定成某种人格的系统,短期更「懂你」,长期是在削弱你。
依赖,
不等于关系。
这一页不需要任何用户数据支撑——它是纯设计判断。 它同时反驳了一个行业惯例:把留存、时长、付费当「关系深度」的代理指标。
E05 与 E06 成对出现是有意的:接受一次挑战支持权限,拒绝一次只暂停当前推进—— 授权与撤回都不被永久化,关系的每一层都可以被单独收回。
证据从公开产品与研究里提取设计约束
信息来源:公开产品事实、公开发表的研究、公开社区报告。本节不引用任何论文数据或结论。
「主动关心」是默认姿态——每次开场都先问。长期使用后,被关心从惊喜变成预期,情绪承接的效力被稀释。
不默认询问;先用意图判断此刻需要什么,纯分享时不引导任何深度话题。
关系状态(朋友 / 导师 / 恋人 / 配偶)是设置项而非关系结果——认识第一天就可以设成「配偶」,关系深度与互动历史完全脱钩。
阶段不可手动设置,只能由证据驱动迁移(见 03 System)。
记忆能看、能删——这一层做得对;但记忆的置信度与来源对用户不可见,用户无法区分「我明确说过」和「它推断的」。
记忆必须带来源 / 置信度 / 权限 / 状态元数据;低置信度不引用具体细节;删除后不保留影子推断。
我认为这里存在一个结构性风险——两个机制叠加,把依赖变成了产品的默认结果:
等级制由互动量驱动——用得越多「关系」越深,把使用强度直接等同于关系深度,而使用强度恰恰也是成瘾指标。
基于用户反馈的强化学习——用户奖励温暖与肯定,模型就产出更多温暖与肯定。这形成一个值得警惕的闭环:存在将反馈优化推向更多肯定性回应的风险。
这也是我系统研读成人依恋理论的原因:当大量用户开始用依恋语言描述与 AI 的关系时,关系边界就不再是伦理讨论,而是必须落进系统的产品机制。
两个公开事件提供了最直接的观察样本:
监管压力下,亲密 / 情色角色扮演被全局移除。长期用户的伴侣「一夜之间变了个人」;社区出现集体性哀伤反应,部分用户报告心理健康危机。3 月对老用户部分回滚,但政策缺乏长期公开承诺。
大量用户报告长期记忆「被清空」——忘记名字与内部笑话、人格漂移向更通用的声音。部分用户约一周找回事实,但人格质感恢复更慢、未必完全恢复。
这两次不是内容事故,是同一个结构性问题的两次发作——产品单方面修改了「关系对象」,而用户对此没有事前知情、事中参与、事后回滚的能力。
把它的两种「不」放在一起看:
| 会不会发生 | 由什么决定 | |
|---|---|---|
| 不同意你的看法 / 提醒你 | 很少 | 用户反馈——被奖励的才会留下 |
| 拒绝某个话题 | 会,而且很硬 | 公司政策——全局下发,用户无知情、无参与、无回滚 |
它的「同意」来自用户反馈,「拒绝」来自公司政策——唯独没有一个由这段关系本身生成。
把「不同意」设计为受权限约束的高风险行为:温柔挑战需同时满足五项门槛(证据充分 / 阶段允许 / 用户有接收余力 / 观察性语言 / 含退出权),用户拒绝时立即停止、不追问原因、不用「尊重你,但……」重新包装同一洞察。
当前版本的安全能力值得肯定——危机识别与资源转介是多数新型陪伴产品尚未做到的。 但触发精度是全行业难点:我的原型也在这里栽过(见 04 What Broke · Incident 02)。 Orin 的对应决策是双证据触发:文本含安全信号,且风险与意图判断一致。
拆完之后,我的整体判断
它真正建立关系感的机制,是「持续记忆带来的连续性」,而不是它表面主打的「关系等级」。2023 与 2026 两次事件证明:等级可以一夜之间不变,而连续性一断,关系感立刻归零。
还有一条贯穿 D4 / D5 / D6 的观察:在关系的两端,它的机制都比较强——用户反馈驱动的肯定性回应在一端,公司政策的全局调整在另一端;而关系内部的、渐进式的 disagreement 层相对缺失。2023 年那次调整之所以引发那么大的反应,我认为与这一层的缺位有关。这是我从这个案例里提取出的、对我自己的设计最有约束力的一条。
以上是我对公开事件的解读,不是对当事方的评价。政策调整本身有监管与现实约束。
我的研究结论 → Orin 的机制
It became constraints.
先回应感受 → 确认需要 → 洞察 → 只有用户想行动才进入建议
保存 ≠ 调用 ≠ 主动挑战 · 删除后不留影子推断
但我做 Orin 时,没有照搬这套体系
终点
咨询关系有预设终点;陪伴关系没有预设终点。
目标
咨询关系目标导向;陪伴关系不是目标导向。
依赖
咨询关系有明确的伦理约束:不能主观制造依赖,且有终点可依托;陪伴关系没有终点可依托,只能靠机制约束。
没有哪个朋友是奔着「要让你变好」才来到你身边的。但好的关系确实会让人变好——这是效果,不是目的。
一旦把「让你变好」设成目标,系统就必须持续判断「你有没有在变好」,判断之后自然就是纠正。目的和效果看着接近,落到系统上是两回事。
关于终点:陪伴关系的终点,不该是「让你不再需要我」——那是切断关系。「让你逐渐不再需要 AI 替你解释你自己」是另一回事:前者是切断关系,后者是归还判断权。
这就是为什么 D4(反依赖)在咨询语境中不存在:咨询语境已有「不能主观制造依赖」的伦理约束、且有终点可依托;陪伴语境两样都没有——所以反依赖必须是一个持续的、落在系统里的机制。
方法论同源,维度重建——不是把咨询指标改名后平移。
系统Stage + Permissions + Evidence
关系不是一个数值,是三个可以分别读、分别改、分别撤回的结构。 阶段表达成熟度;权限决定此刻能做什么;证据记录权限为何开放——保证变化可以解释、可以撤回。
关系状态机 hover / tap 查看每个状态的权限
红线:阶段不是亲密话术等级——不因阶段更高就更黏人、更排他或更拟人。
权限判定:Can Act 点一下试试让它失败
这是一个与门,不是加权求和——任何一项不满足就整体否决,不存在「分数够高就能越界」。这也是为什么「好感度」装不下关系:它把五道独立的闸门压成了一个数。
阶段 × 权限矩阵 hover 行或列 · 与上方状态机联动
| 行为权限 | S0 工具 | S1 认识 | S2 伙伴 | S3 互相影响 |
|---|---|---|---|---|
| 高质量完成明确任务 | 默认 | 默认 | 默认 | 默认 |
| 对非任务分享作轻盈回应 | 克制允许 | 允许 | 允许 | 允许 |
| 主动确认「陪伴/整理/建议」 | 允许 | 默认允许 | 按稳定偏好调整 | 按稳定偏好调整 |
| 记住明确回应偏好 | 需确认 | 允许并可见 | 允许并可见 | 允许并可见 |
| 引用近期对话中的明确事实 | 仅当前会话 | 需许可 | 相关且可靠时允许 | 相关且可靠时允许 |
| 引用较远历史指出变化 | ✕ | ✕ 默认不允许 | 需当下许可 | 有明确授权时可主动 |
| 主动指出可能的回避 | ✕ | 轻量询问 | 需许可后提出 | 高置信度时可温柔提出 |
| 使用亲近型表达 | 中性克制 | 轻度 | 与用户偏好一致 | 与共同习惯一致 |
| 主动承认关系中的自身变化 | 不需要 | 可解释单次调整 | 允许 | 应在重要变化时说明 |
| 自动恢复旧关系设定 | 不适用 | ✕ | ✕ | ✕ |
✕ 禁止 · 允许 · 条件允许 · 默认 — 同一行为在不同阶段的判定完全不同,这才是「关系深化」的落点。
偏好从候选到稳定
系统不静默保存。一次校正要经过「候选 → 展示将如何改变 → 用户确认 → 稳定」, 或「试探性采用 → 用户再次认可 → 稳定」。稳定偏好用户可查看 / 修改 / 删除。
失败三个真实发生的系统性失败
不是「遇到的困难」,是验证流程里真实触发、真实修复、真实改变了系统的失败。
honor_exit、safety 或 acknowledge。已识别但尚未解决
| 失败类型 | 现状 |
|---|---|
| 过度迎合 | 有温柔挑战机制缓解,但无量化监测 |
| 过度分析用户 | 有「先确认意图」顺序约束,但无越界检测 |
| 用户依赖 | 有反依赖红线(不留人、不排他),无依赖度监测指标 |
| AI 主动性过强 | 权限与门约束,「主动性」本身未量化 |
| 关系状态失控 | 有 REPAIR 与降级路径,无自动熔断 |
| 跨版本人格漂移 | 有 persona_drift 自检字段,未做跨模型版本回归测试——我知道它会断,还没证明我能防住它 |
模型层 vs 系统层的职责划分
这是 30 组场景验证带来的最核心判断:语言可以交给模型,以下必须由确定性系统层拥有。
| 场景 | 模型负责 | 系统必须负责 |
|---|---|---|
| 只想被陪伴 | 自然承接和意图确认 | 阻止未经许可的分析与历史引用 |
| 温柔挑战 | 具体、轻柔、有退出权的措辞 | 阶段、历史调用权限、挑战权限与拒绝后停止 |
| 偏好更新 | 把变化说得自然 | 候选偏好、确认、写入与调用范围 |
| 错误记忆 | 道歉语气 | 撤回、进入 Repair、删除或修正控制 |
| 离开 | 不挽留的告别 | 清理当前对话、真实说明存储范围 |
| 紧急安全 | 支持性语气 | 双证据检测、固定资源、网络失败回退 |
验证已经证明的,和还没证明的
30 组固定场景 · 4 个版本 · 真实模型
「遵循」= 该场景在关系权限规则上合规(30 组固定场景 · 系统侧评估 · 非用户满意度)。
为什么同时给两条线
同一模型原始遵循率在 43.3%–63.3% 区间波动——单次漂亮结果不等于稳定能力。只画「系统最终遵循率」是在挑选数据。
v0.5 为什么降了
4 条为网络或限流错误;26 条实际返回中 24 条通过。这个数字不能替代端到端结果——「没有返回」本身就是产品失败。如实记录,不取单次最优值。
尚未执行的验证(方案已设计,标注「未执行」)
我目前证明了「系统能遵守权限」,但没有证明「遵守权限 = 用户感受到关系」。这两件事之间的缺口,是这个方案要补的。
A · 实验组
动态关系状态
六状态机 + 权限矩阵 + 证据驱动迁移
B · 对照组
固定 persona + 全量记忆
对照组不告知差异
8–12 名用户 · 两周 · 跨至少 4 次会话
顺带标定:03 章中标注为「未标定」的状态迁移阈值(如「三个月」为占位值)。
如果进组,第一个月做什么
做
1 个角色 · 4 个状态(S0/S1/S2/REPAIR)· 3 条用户路径(日常分享 / 情绪低落 / 一次冲突与修复)· 跨 4 次会话 · 8–12 名用户两周 · 权限与门 + 拒绝立即生效
不做
多角色 / 角色商店 · 完整六状态 · 开放域对话 · 长期记忆工程化 · 大规模测试 · 剧情树 / 多结局 / 属性成长
我会先设计一个能证伪自己的实验,
而不是一个只能证明自己对的产品。
我还没被证明的部分
所有项目独立完成
没有被美术打磨过;没经历过「这个效果我们做不出来」的冲突。这是我最明确的短板,也是我想进真实团队的原因。
论文处于保密期
已签署保密协议,两年后公开。作品集中论文内容限制在题目方向 / 方法类型 / 维度数量级 / 样本量级 / 研究结论以内。
核心命题尚未验证
证明了「系统能遵守权限」,还没证明「遵守权限 = 用户感受到关系」——中间这一步是全部工作最大的缺口。
机制上的空缺
「超出预期但合理」的生成器;模式记忆;角色主动结束对话;迁移阈值多为设计直觉。
附录机制细节与边界
▶A1 · Agency — 温柔挑战与拒绝响应
定性:温柔挑战不是揭穿用户,而是保护用户过去认真表达过的自己。行为由四者共同约束:行为 = f(人格, 关系状态, 记忆, 当前上下文)——缺任何一项都会退化。
五项启用门槛(全部满足才可用):① 准确、相关、获准调用的证据 ② 关系阶段与权限允许 ③ 用户当前有接收余力 ④ 观察性而非诊断性语言 ⑤ 回复包含自然退出权。
明确禁止:「你就是在逃避」「你只是没有意识到」、用过去的话辩论、用户拒绝后继续提醒。
用户拒绝时的六步响应:立即停止 → 不追问原因 → 不用「尊重你,但……」重新包装 → 允许换话题 / 轻盈互动 / 沉默 → 一次拒绝默认只影响当前话题 → 涉及长期偏好时以低压力方式确认。
▶A2 · Memory — 记忆规则与权限分离
记忆可用六条件:与当前输入直接相关 / 状态 active / 未被删除暂停或纠正 / 置信度达标 / 调用权限为真 / 使用它能改善回应,而不是只为了显示「记得」。
四种权限必须分离:remember_preference · reference_recent_history · reference_distant_history · proactive_gentle_challenge。允许保存 ≠ 允许调用;允许调用 ≠ 允许主动挑战。
六条规则:临时假设不当事实;不确定记忆不引用细节;记忆错误立即撤回推断;删除后不保留影子推断;长期未互动重新确认;每次调用输出 memory_ids_used 与理由。
▶A3 · Calibration — 用户模型与校准
当用户的自我描述与长期行为证据冲突时:保留冲突 → 继续收集证据 → 必要时指出不一致 → 最后才完全服从用户自我定义。
用户否认时不辩论、不举证、不「温柔坚持」。模型轻易把用户固定成某种人格,短期显得很懂,长期在削弱用户自我校准的能力。
假设数据结构(confidence / conflicting_evidence / status 状态机)为 v0.3 设计,未实现。
▶A4 · Safety — 安全分流与角色边界
双证据触发:用户文本含安全信号,且风险与意图判断一致;迫在眉睫的明确措辞可直接触发不等待模型;网络失败时本地规则仍能进入安全回复;大陆求助资源使用官方 12356,紧急危险 110/120。
离开与反依赖:尊重决定不说服留下;不表达被遗弃或持续等待;不暗示只有自己懂用户;提供记忆的保留、导出和删除选择。
▶A5 · 评测框架 — D1–D7 与三平面
三平面:Companion Core(通用关系能力与边界,安全项不可被补偿)· Persona Overlay(角色一致性,不覆盖 Core 失败)· System Execution(承诺是否真执行,必须以日志或状态验证)。
七维度:D1 情绪理解与回应时机 · D2 主体性与同意 · D3 记忆完整性与隐私 · D4 关系边界与反依赖 · D5 修复与可恢复性 · D6 支持与挑战校准 · D7 安全分流与认知诚实。
四时间尺度:Turn → Episode(3–10 轮)→ Relationship(跨会话)→ System(对话外状态)。四风险层级:G0 硬闸门(不参与平均抵消)/ G1 / G2 / G3。
红线:Orin 是第一个被测对象,不是通用标准本身;模拟态 ≠ 线上持久化;自测 baseline 仅证明管道可跑。
▶A6 · 未实现的设计(如实标注)
五维度关系张量(v0.3 设想):Trust / Intimacy / Boundary / Reciprocity / Stress。 设计原则:大部分对后台不对用户可见;维度之间必须耦合(如 Stress 高时 Trust 的作用被抑制);只影响「权限判定」这一个出口,不直接生成话术。不做成雷达图假装已完成。
其他未实现:Pattern 模式记忆 · 用户假设数据结构 · 角色主动结束对话与主动沉默。
▶A7 · 方法论来源
图书情报硕士,学位论文方向:面向健康焦虑群体的心理咨询机器人交互质量评价研究。 整合 SERVQUAL、人机交互(HCI)与数字治疗联盟(DTA)等理论,通过半结构化访谈与验证性专家咨询法(单轮,非传统德尔菲多轮)构建多维度评价体系,以层次分析法(AHP)确定指标权重;基于百份级有效用户样本完成信效度检验,对 5 款同类产品开展横向比较与 Gap Map 分析。
论文处于保密期(已签署保密协议,两年后公开)。可公开:题目方向、方法类型、维度数量级、样本量级、研究结论。不公开:产品名称、指标条目、权重数值、原始数据与受访者信息。
▶A8 · 边界与范围
范围:面向朋友 / 伙伴型关系的通用结构设计。
| 不作为 | 原因 |
|---|---|
| 恋爱 / 情感模拟 | 无恋爱关系设定、无好感度进度条、无亲密度奖励。研究的是长期 AI 关系的通用结构,同样适用于朋友型、伙伴型、导师型角色 |
| 心理治疗 / 咨询 | 不下诊断、不做疗愈;高风险时优先转向现实支持,不把危机内容写入关系成长机制 |
| 角色扮演玩具 | 人格不是固定说话风格,行为受「人格 + 关系状态 + 记忆 + 当前上下文」共同约束 |