点击蓝字,关注J🤡KER
引言
强化学习中的智能体,
会根据反馈调整策略。
奖励变少时,
它通常减少无效探索。
但进入恋爱环境后,
这套规则突然失灵。
对方真实意图不可见,
回复还会延迟或含糊。
一句“早点睡”,
可能是温柔的关心,
也可能是在结束对话。
人只能看见聊天窗口,
却看不见环境源码。
少量偶然的积极反馈,
还可能盖过长期冷淡。
于是低收益的等待,
被解释成仍有希望。
论文将这一现象称为:
恋爱强化学习失败。
它不是心理诊断,
而是一套分析框架。
01
爱情是部分可观测的
在普通学习任务中,
状态通常相对明确。
但在亲密关系里,
观测不等于真实状态。
收到一个“哈哈”,
只能证明对方回复了。
它不能直接证明,
关系正在稳定升温。
已读时间是观测,
喜欢与否却是隐藏状态。
更麻烦的是,
同一条消息的奖励值,
会因等待时间而改变。
平时普通的一句“嗯嗯”,
在失联三天以后,
也可能像巨大惊喜。
这种含噪反馈,
让人难以正确更新判断。
你以为自己读懂了信号,
其实只读到了界面。
02
回复可能是错误目标
一个人真正想要的,
通常是稳定和相互的关系。
但这个目标很难测量。
于是人会选择更易观察的,
回复次数、速度与字数。
只要回复变快了,
便觉得关系有所进展。
只要话题聊得更久,
便认为自己正在成功。
可这些代理指标,
不等于真实关系质量。
你可能不断更换话题,
努力提高对方回复率。
聊天数据越来越漂亮,
承诺却始终没有出现。
这就是奖励黑客:
系统非常努力,
却优化了错误目标。
仪表盘全部变绿,
关系状态依然离线。
03
为何总怪自己不够好
人不会平等处理证据。
支持期待的瞬间,
往往被赋予更高权重。
第一次主动聊天,
可能被反复回想。
第一百次没有回复,
却被解释成对方太忙。
确认偏误会保护期待,
高价值记忆则反复重播。
负面证据无法改变判断,
反而被改写成:
“是我还不够好。”
这个解释十分危险。
因为它几乎无法证伪。
任何冷淡都能变成,
继续自我改造的理由。
于是你更新了健身计划,
更新了英语和摄影。
却始终没有更新:
这段关系是否值得继续。
长期暧昧也没有终点,
每次沉默都能被解释。
只要回合没有结束,
下一条消息便叫继续采样。
04
模型真会永不收敛吗
研究模拟了一万个智能体,
每个训练三百六十五轮。
理性智能体拿到答案,
普通智能体闭卷考试。
偏差智能体不仅闭卷,
还带着旧聊天记录。
结果显示,
认知偏差提高持续探索,
扩大主观与实际差距,
并让收敛来得更迟。
但三类智能体,
最终都在期限内收敛。
模型证明的是延迟收敛,
不是永远无法退出。
奖励消融还发现,
积极奖励越少,
探索反而越快下降。
因此,“越不回复,
对方就会越上头”,
并未获得实验支持。
合成问卷也只能证明,
统计流程能够运行。
它不能替代真人样本,
更不是心理学定论。
最后,想说的是
这篇论文真正揭示的,
不是爱情等于算法。
而是人在模糊关系中,
可能如何误读反馈。
稀疏且随机的奖励,
让偶然温柔格外耀眼。
错误的代理目标,
让回复冒充关系进展。
确认偏误与旧日记忆,
让负面证据不断失效。
缺少明确的终止信号,
又让等待无限延长。
但研究同样提醒我们:
不是越冷淡越让人上头,
也不是坚持必然错误。
问题只在于,
客观回报长期为负时,
你是否仍拒绝更新判断。
真正需要优化的,
也许不是更好的自己。
而是及时重新估计:
这段关系值得继续吗?
稿件来源 | MAURICE
改编排版 | Big Yellow Dog 🐾
点击蓝字 关注我们