第47章 反馈学习
第46章建立了一个重要结论:
环境反馈不是认知过程的结束,而是下一次认知的开始。
但是,仅仅能够根据反馈重新判断当前状态,还不能称为真正的学习。
如果系统每一次都重新开始:
感知
↓
认知
↓
行为
↓
反馈
↓
修正
下一次遇到相同情况时,又完全重复原来的过程,那么系统只是具有反馈响应能力,而没有真正形成学习。
因此,本章需要解决一个更核心的问题:
反馈如何从一次性的“当前修正”,转化为能够影响未来认知的“学习结果”?
47.1 什么是反馈学习
反馈学习可以定义为:
个体根据行为产生的环境反馈,对已有认知、匹配关系、权重、经验或行为方式进行更新,使未来面对相似情况时产生不同认知或行为的过程。
因此,反馈学习至少包含两个时间点:
过去
↓
当前反馈
↓
未来
如果反馈只影响当前:
当前状态改变
那么属于状态更新。
如果反馈进一步影响未来:
未来认知改变
才进入学习。
因此:
反馈
↓
当前状态更新
是反馈响应。
而:
反馈
↓
认知结构更新
↓
未来认知改变
才是反馈学习。
47.2 反馈学习与状态更新的区别
这是认知工程中必须明确区分的两个概念。
例如一个人拿鸡蛋。
第一次抓取过程中:
压力 ↑
滑移 ↑
系统立即降低手指压力。
这属于:
反馈
↓
当前状态变化
↓
当前行为调整
但是,如果下一次抓鸡蛋时,系统一开始就自动降低压力,则说明第一次反馈已经改变了未来行为。
形成:
第一次抓取
↓
滑移反馈
↓
经验更新
↓
第二次抓取
↓
提前调整
这才是学习。
因此:
状态更新解决“现在怎么办”,反馈学习解决“下一次怎么办”。
47.3 学习发生在时间之间
反馈学习具有明显的时间结构:
t₁
↓
行为
↓
反馈
↓
学习
↓
t₂
↓
新的认知
因此可以表示为:
Cognition(t)
↓
Decision(t)
↓
Behavior(t)
↓
Feedback(t)
↓
Learning(t → t+1)
↓
Cognition(t+1)
这里最关键的是:
Cognition(t+1)
与:
Cognition(t)
已经不完全相同。
这意味着系统发生了认知状态之外的另一种变化:
认知结构本身发生变化。
47.4 反馈学习的基本过程
一个完整的反馈学习过程可以分成六个阶段:
感知
↓
认知
↓
行为
↓
反馈
↓
差异判断
↓
学习更新
进一步展开:
当前状态
↓
当前认知
↓
当前决策
↓
执行行为
↓
获得反馈
↓
比较预期与实际
↓
发现差异
↓
调整认知参数
↓
形成新的认知倾向
因此反馈学习并不是简单地“记住结果”。
它实际上是:
利用结果改变未来的认知过程。
47.5 预期与实际
反馈学习的一个重要基础,是系统能够区分:
预期
与:
实际
例如:
预期:
鸡蛋可以稳定抓取
执行行为后:
实际:
鸡蛋发生滑移
于是:
预期 ≠ 实际
产生差异:
Prediction Difference
可以抽象为:
Expected State
↓
Behavior
↓
Actual State
↓
Difference
这个差异为学习提供了依据。
47.6 反馈不是简单的“奖惩”
反馈学习不应该被简单理解成:
好 → 奖励
坏 → 惩罚
因为人的反馈远比二元奖惩复杂。
一次行为可能同时包含多个反馈:
任务完成
+
速度较慢
+
稳定性较高
+
压力偏大
+
对象没有损伤
因此反馈本身可以是一个多维结构:
Feedback
{
task,
stability,
safety,
damage,
speed,
efficiency,
state_change
}
不同反馈维度可能产生不同的学习方向。
例如:
任务完成 → 保留当前策略
压力过高 → 降低压力权重
速度过慢 → 提高效率权重
对象损伤 → 提高保护权重
因此:
反馈学习本质上是多维反馈对认知结构的调整。
47.7 反馈如何改变属性权重
第24章已经提出:
不同属性在认知匹配中的重要程度不同。
第25章进一步建立:
权重可以动态变化。
现在加入反馈学习后,可以形成:
反馈
↓
属性结果
↓
重要性重新评估
↓
权重更新
例如:
第一次:
压力权重 = 0.30
滑移权重 = 0.20
形变权重 = 0.20
速度权重 = 0.30
如果反馈发现对象出现滑移:
滑移风险 ↑
下一次可能形成:
压力权重 ↑
滑移权重 ↑
速度权重 ↓
这意味着系统不只是记住:
“刚才滑了。”
而是形成:
“在这种对象和这种任务下,滑移应该更加受到关注。”
这才是认知层面的学习。
47.8 反馈学习改变匹配方式
进一步看,学习并不一定直接改变某一个属性。
它还可能改变属性之间的匹配关系。
例如第一次系统分别观察:
压力
摩擦
滑移
之后发现:
压力 ↑
+
摩擦 ↓
→
滑移 ↑
于是系统逐渐形成一个动态关系:
Pressure
+
Friction
↓
Slip Risk
下一次遇到类似变化时,系统不再分别判断三个属性,而会更快地进行协同匹配。
因此:
反馈
↓
属性关系发现
↓
关系保存
↓
未来匹配改变
这说明反馈学习不仅能够学习:
Value
还可以学习:
Relation
甚至学习:
Dynamic Relation
47.9 反馈学习改变认知概率
第26章建立了认知概率:
Matching
↓
Strength
↓
Weight
↓
Probability
↓
Cognition
反馈学习可以进一步改变其中的参数。
例如:
第一次:
对象失稳概率 = 0.20
行为之后发生明显滑移:
实际结果:
失稳风险增加
系统更新后:
对象失稳概率 = 0.60
再次面对类似情况:
失稳概率较高
于是认知和决策都会提前变化。
所以:
学习并不一定直接产生一个固定结论,而可以改变未来认知中的概率分布。
47.10 反馈学习与经验形成
第28章讨论了个体经验。
现在可以进一步说明经验如何形成:
事件
↓
行为
↓
反馈
↓
结果
↓
重复出现
↓
经验形成
例如:
抓取鸡蛋
↓
压力过高
↓
出现滑移
↓
降低压力
↓
成功稳定抓取
如果这种关系重复出现:
高压力
+
特定对象
↓
高滑移风险
就可能形成经验:
面对类似对象时,应避免过高压力。
因此经验不是凭空产生的。
它可以来自:
行为结果
+
反馈
+
重复
47.11 一次反馈与重复反馈
一次反馈可以改变当前判断。
重复反馈才更容易形成稳定经验。
可以表示为:
一次反馈
↓
当前修正
而:
多次类似反馈
↓
模式发现
↓
经验形成
进一步:
经验
↓
权重变化
↓
先验变化
↓
未来认知变化
因此学习具有一个逐步过程:
反馈
↓
修正
↓
重复
↓
模式
↓
经验
↓
认知倾向
47.12 反馈学习与记忆
经验如果不能保存,就无法影响未来。
因此反馈学习还必须与记忆发生联系:
反馈
↓
学习
↓
经验
↓
记忆
下一次遇到相似对象:
当前感知
+
历史记忆
↓
匹配
例如:
当前:
鸡蛋
压力增加
系统调用过去记忆:
过去:
类似压力曾经导致滑移
于是:
风险权重 ↑
这说明:
记忆使学习产生时间上的延续性。
没有记忆,学习只能停留在当前时刻。
47.13 反馈学习与先验
当某种经验被长期积累之后,它还可能改变个体先验。
例如一个人长期处理易碎物品之后,会形成一种稳定预期:
易碎对象
→
高风险
即使当前对象还没有发生损伤,个体也会提前采取更加谨慎的行为。
因此:
经验
↓
重复
↓
稳定认知
↓
先验
这就是:
反馈学习从过去结果进入未来预期。
第30章“个体先验”因此可以在这里得到一个重要来源:
过去反馈
↓
学习
↓
经验
↓
先验
47.14 反馈学习与个体差异
不同个体接受相同反馈之后,不一定学习出相同结果。
例如两个人都经历:
玻璃杯掉落并破碎
个体A:
经验:
玻璃很脆弱
个体B:
经验:
需要更加注意握持方式
两个人保存的信息重点不同。
未来再次面对玻璃杯:
A:
重点关注对象脆弱性
B:
重点关注握持方式
于是:
相同反馈
+
不同个体结构
↓
不同学习结果
因此学习本身也是个体化的。
47.15 反馈学习不是简单复制过去
一个真正的认知系统不能只是:
过去发生过什么
↓
下次完全照做
因为现实环境不断变化。
真正的学习应该是:
过去经验
+
当前状态
+
当前目标
+
当前反馈
↓
新的认知
也就是说:
经验影响当前认知,但不能完全取代当前感知。
例如过去某种鸡蛋需要轻压力,并不意味着所有鸡蛋、所有抓取方式、所有任务都必须使用完全相同的压力。
当前对象可能不同:
大小不同
重量不同
表面不同
位置不同
任务不同
因此学习应该改变:
倾向
权重
概率
匹配方式
而不是简单复制过去动作。
47.16 学习的本质是改变未来
从理论上看,学习最重要的判断标准只有一个:
学习之后,未来是否发生变化?
可以表示为:
Learning
=
Change in Future Cognition
进一步:
学习前:
Input
↓
Cognition₁
↓
Decision₁
↓
Behavior₁
学习:
Feedback
↓
Update
学习后:
同类Input
↓
Cognition₂
↓
Decision₂
↓
Behavior₂
如果:
Cognition₂ ≠ Cognition₁
或者:
Decision₂ ≠ Decision₁
那么系统确实发生了学习。
47.17 建立反馈学习模型
因此,可以建立第47章的基本模型:
Experience(t)
+
Current State(t)
+
Goal(t)
↓
Cognition(t)
↓
Decision(t)
↓
Behavior(t)
↓
Feedback(t)
↓
Prediction / Actual Difference
↓
Learning Update
↓
Experience(t+1)
Memory(t+1)
Weight(t+1)
Prior(t+1)
↓
Cognition(t+1)
这里第一次出现一个重要的工程概念:
Update
因为学习的核心不是“读取数据”,而是:
旧状态
↓
新反馈
↓
更新
↓
新状态
47.18 反馈学习的最小工程结构
从理论工程角度,可以将反馈学习抽象成:
Feedback
↓
Evaluator
↓
Difference
↓
Learning Rule
↓
Update
↓
Memory / Experience / Weight / Prior
例如:
Feedback
↓
评估结果
↓
发现滑移
↓
提高滑移风险权重
↓
保存经验
因此反馈学习已经开始从理论进入工程结构。
它不再只是一个心理学概念,而可以被描述为:
输入
+
判断
+
更新规则
+
输出
这为后面的:
Cognitive Method
Cognitive Class
Learning Engine
提供理论基础。
47.19 反馈学习的核心闭环
最终可以把本章压缩成:
当前认知
↓
决策
↓
行为
↓
环境
↓
反馈
↓
预期与实际比较
↓
学习
↓
┌─────────┼──────────┐
↓ ↓ ↓
经验 权重 记忆
↓ ↓ ↓
└─────────┼──────────┘
↓
先验
↓
未来认知
↓
决策
47.20 本章结论
第46章解决的是:
环境变化如何反馈给认知系统。
第47章进一步解决:
反馈如何改变未来的认知。
因此两者之间存在一个关键区别:
环境反馈
↓
当前状态更新
属于:
反馈响应
而:
环境反馈
↓
经验/记忆/权重/先验更新
↓
未来认知改变
属于:
反馈学习
最终可以形成:
反馈
↓
状态更新
↓
认知修正
↓
经验形成
↓
记忆保存
↓
权重调整
↓
先验变化
↓
未来认知变化
因此,本章的核心定义可以表述为:
反馈学习,是个体利用行为产生的环境反馈,对自身的经验、记忆、匹配权重和认知先验进行持续更新,使未来面对相似或相关状态时形成不同认知、决策与行为的过程。
由此,第十一篇正式开始。
第47章 反馈学习
↓
第48章 经验学习
↓
第49章 匹配权重学习
↓
第50章 个体认知变化
↓
第51章 行为与认知共同变化
而下一章要进一步回答的问题是:
如果反馈能够产生经验,那么个体究竟是如何从一次次具体事件中提取规律,并把“发生过的事情”转化为可以再次使用的经验?