首页 理论 架构 工程 文档 白皮书 著作 研究 案例 下载 博客 关于 开始使用 →

第47章 反馈学习

第47章 反馈学习

第46章建立了一个重要结论:

环境反馈不是认知过程的结束,而是下一次认知的开始。

但是,仅仅能够根据反馈重新判断当前状态,还不能称为真正的学习。

如果系统每一次都重新开始:

感知
 ↓
认知
 ↓
行为
 ↓
反馈
 ↓
修正

下一次遇到相同情况时,又完全重复原来的过程,那么系统只是具有反馈响应能力,而没有真正形成学习。

因此,本章需要解决一个更核心的问题:

反馈如何从一次性的“当前修正”,转化为能够影响未来认知的“学习结果”?


47.1 什么是反馈学习

反馈学习可以定义为:

个体根据行为产生的环境反馈,对已有认知、匹配关系、权重、经验或行为方式进行更新,使未来面对相似情况时产生不同认知或行为的过程。

因此,反馈学习至少包含两个时间点:

过去
 ↓
当前反馈
 ↓
未来

如果反馈只影响当前:

当前状态改变

那么属于状态更新

如果反馈进一步影响未来:

未来认知改变

才进入学习

因此:

反馈
 ↓
当前状态更新

是反馈响应。

而:

反馈
 ↓
认知结构更新
 ↓
未来认知改变

才是反馈学习。


47.2 反馈学习与状态更新的区别

这是认知工程中必须明确区分的两个概念。

例如一个人拿鸡蛋。

第一次抓取过程中:

压力 ↑
滑移 ↑

系统立即降低手指压力。

这属于:

反馈
 ↓
当前状态变化
 ↓
当前行为调整

但是,如果下一次抓鸡蛋时,系统一开始就自动降低压力,则说明第一次反馈已经改变了未来行为。

形成:

第一次抓取
 ↓
滑移反馈
 ↓
经验更新
 ↓
第二次抓取
 ↓
提前调整

这才是学习。

因此:

状态更新解决“现在怎么办”,反馈学习解决“下一次怎么办”。


47.3 学习发生在时间之间

反馈学习具有明显的时间结构:

t₁
 ↓
行为
 ↓
反馈
 ↓
学习
 ↓
t₂
 ↓
新的认知

因此可以表示为:

Cognition(t)
        ↓
Decision(t)
        ↓
Behavior(t)
        ↓
Feedback(t)
        ↓
Learning(t → t+1)
        ↓
Cognition(t+1)

这里最关键的是:

Cognition(t+1)

与:

Cognition(t)

已经不完全相同。

这意味着系统发生了认知状态之外的另一种变化:

认知结构本身发生变化。


47.4 反馈学习的基本过程

一个完整的反馈学习过程可以分成六个阶段:

感知
 ↓
认知
 ↓
行为
 ↓
反馈
 ↓
差异判断
 ↓
学习更新

进一步展开:

当前状态
 ↓
当前认知
 ↓
当前决策
 ↓
执行行为
 ↓
获得反馈
 ↓
比较预期与实际
 ↓
发现差异
 ↓
调整认知参数
 ↓
形成新的认知倾向

因此反馈学习并不是简单地“记住结果”。

它实际上是:

利用结果改变未来的认知过程。


47.5 预期与实际

反馈学习的一个重要基础,是系统能够区分:

预期

与:

实际

例如:

预期:
鸡蛋可以稳定抓取

执行行为后:

实际:
鸡蛋发生滑移

于是:

预期 ≠ 实际

产生差异:

Prediction Difference

可以抽象为:

Expected State
       ↓
    Behavior
       ↓
Actual State
       ↓
Difference

这个差异为学习提供了依据。


47.6 反馈不是简单的“奖惩”

反馈学习不应该被简单理解成:

好 → 奖励
坏 → 惩罚

因为人的反馈远比二元奖惩复杂。

一次行为可能同时包含多个反馈:

任务完成
+
速度较慢
+
稳定性较高
+
压力偏大
+
对象没有损伤

因此反馈本身可以是一个多维结构:

Feedback
{
    task,
    stability,
    safety,
    damage,
    speed,
    efficiency,
    state_change
}

不同反馈维度可能产生不同的学习方向。

例如:

任务完成 → 保留当前策略
压力过高 → 降低压力权重
速度过慢 → 提高效率权重
对象损伤 → 提高保护权重

因此:

反馈学习本质上是多维反馈对认知结构的调整。


47.7 反馈如何改变属性权重

第24章已经提出:

不同属性在认知匹配中的重要程度不同。

第25章进一步建立:

权重可以动态变化。

现在加入反馈学习后,可以形成:

反馈
 ↓
属性结果
 ↓
重要性重新评估
 ↓
权重更新

例如:

第一次:

压力权重 = 0.30
滑移权重 = 0.20
形变权重 = 0.20
速度权重 = 0.30

如果反馈发现对象出现滑移:

滑移风险 ↑

下一次可能形成:

压力权重 ↑
滑移权重 ↑
速度权重 ↓

这意味着系统不只是记住:

“刚才滑了。”

而是形成:

“在这种对象和这种任务下,滑移应该更加受到关注。”

这才是认知层面的学习。


47.8 反馈学习改变匹配方式

进一步看,学习并不一定直接改变某一个属性。

它还可能改变属性之间的匹配关系。

例如第一次系统分别观察:

压力
摩擦
滑移

之后发现:

压力 ↑
+
摩擦 ↓
→
滑移 ↑

于是系统逐渐形成一个动态关系:

Pressure
   +
Friction
   ↓
Slip Risk

下一次遇到类似变化时,系统不再分别判断三个属性,而会更快地进行协同匹配。

因此:

反馈
 ↓
属性关系发现
 ↓
关系保存
 ↓
未来匹配改变

这说明反馈学习不仅能够学习:

Value

还可以学习:

Relation

甚至学习:

Dynamic Relation

47.9 反馈学习改变认知概率

第26章建立了认知概率:

Matching
 ↓
Strength
 ↓
Weight
 ↓
Probability
 ↓
Cognition

反馈学习可以进一步改变其中的参数。

例如:

第一次:

对象失稳概率 = 0.20

行为之后发生明显滑移:

实际结果:
失稳风险增加

系统更新后:

对象失稳概率 = 0.60

再次面对类似情况:

失稳概率较高

于是认知和决策都会提前变化。

所以:

学习并不一定直接产生一个固定结论,而可以改变未来认知中的概率分布。


47.10 反馈学习与经验形成

第28章讨论了个体经验。

现在可以进一步说明经验如何形成:

事件
 ↓
行为
 ↓
反馈
 ↓
结果
 ↓
重复出现
 ↓
经验形成

例如:

抓取鸡蛋
 ↓
压力过高
 ↓
出现滑移
 ↓
降低压力
 ↓
成功稳定抓取

如果这种关系重复出现:

高压力
+
特定对象
 ↓
高滑移风险

就可能形成经验:

面对类似对象时,应避免过高压力。

因此经验不是凭空产生的。

它可以来自:

行为结果
+
反馈
+
重复

47.11 一次反馈与重复反馈

一次反馈可以改变当前判断。

重复反馈才更容易形成稳定经验。

可以表示为:

一次反馈
 ↓
当前修正

而:

多次类似反馈
 ↓
模式发现
 ↓
经验形成

进一步:

经验
 ↓
权重变化
 ↓
先验变化
 ↓
未来认知变化

因此学习具有一个逐步过程:

反馈
 ↓
修正
 ↓
重复
 ↓
模式
 ↓
经验
 ↓
认知倾向

47.12 反馈学习与记忆

经验如果不能保存,就无法影响未来。

因此反馈学习还必须与记忆发生联系:

反馈
 ↓
学习
 ↓
经验
 ↓
记忆

下一次遇到相似对象:

当前感知
+
历史记忆
 ↓
匹配

例如:

当前:
鸡蛋
压力增加

系统调用过去记忆:

过去:
类似压力曾经导致滑移

于是:

风险权重 ↑

这说明:

记忆使学习产生时间上的延续性。

没有记忆,学习只能停留在当前时刻。


47.13 反馈学习与先验

当某种经验被长期积累之后,它还可能改变个体先验。

例如一个人长期处理易碎物品之后,会形成一种稳定预期:

易碎对象
→
高风险

即使当前对象还没有发生损伤,个体也会提前采取更加谨慎的行为。

因此:

经验
 ↓
重复
 ↓
稳定认知
 ↓
先验

这就是:

反馈学习从过去结果进入未来预期。

第30章“个体先验”因此可以在这里得到一个重要来源:

过去反馈
 ↓
学习
 ↓
经验
 ↓
先验

47.14 反馈学习与个体差异

不同个体接受相同反馈之后,不一定学习出相同结果。

例如两个人都经历:

玻璃杯掉落并破碎

个体A:

经验:
玻璃很脆弱

个体B:

经验:
需要更加注意握持方式

两个人保存的信息重点不同。

未来再次面对玻璃杯:

A:
重点关注对象脆弱性

B:
重点关注握持方式

于是:

相同反馈
+
不同个体结构
 ↓
不同学习结果

因此学习本身也是个体化的。


47.15 反馈学习不是简单复制过去

一个真正的认知系统不能只是:

过去发生过什么
 ↓
下次完全照做

因为现实环境不断变化。

真正的学习应该是:

过去经验
+
当前状态
+
当前目标
+
当前反馈
 ↓
新的认知

也就是说:

经验影响当前认知,但不能完全取代当前感知。

例如过去某种鸡蛋需要轻压力,并不意味着所有鸡蛋、所有抓取方式、所有任务都必须使用完全相同的压力。

当前对象可能不同:

大小不同
重量不同
表面不同
位置不同
任务不同

因此学习应该改变:

倾向
权重
概率
匹配方式

而不是简单复制过去动作。


47.16 学习的本质是改变未来

从理论上看,学习最重要的判断标准只有一个:

学习之后,未来是否发生变化?

可以表示为:

Learning
=
Change in Future Cognition

进一步:

学习前:

Input
 ↓
Cognition₁
 ↓
Decision₁
 ↓
Behavior₁

学习:

Feedback
 ↓
Update

学习后:

同类Input
 ↓
Cognition₂
 ↓
Decision₂
 ↓
Behavior₂

如果:

Cognition₂ ≠ Cognition₁

或者:

Decision₂ ≠ Decision₁

那么系统确实发生了学习。


47.17 建立反馈学习模型

因此,可以建立第47章的基本模型:

Experience(t)
      +
Current State(t)
      +
Goal(t)
      ↓
   Cognition(t)
      ↓
   Decision(t)
      ↓
   Behavior(t)
      ↓
   Feedback(t)
      ↓
Prediction / Actual Difference
      ↓
   Learning Update
      ↓
Experience(t+1)
Memory(t+1)
Weight(t+1)
Prior(t+1)
      ↓
   Cognition(t+1)

这里第一次出现一个重要的工程概念:

Update

因为学习的核心不是“读取数据”,而是:

旧状态
 ↓
新反馈
 ↓
更新
 ↓
新状态

47.18 反馈学习的最小工程结构

从理论工程角度,可以将反馈学习抽象成:

Feedback
    ↓
Evaluator
    ↓
Difference
    ↓
Learning Rule
    ↓
Update
    ↓
Memory / Experience / Weight / Prior

例如:

Feedback
 ↓
评估结果
 ↓
发现滑移
 ↓
提高滑移风险权重
 ↓
保存经验

因此反馈学习已经开始从理论进入工程结构。

它不再只是一个心理学概念,而可以被描述为:

输入
+
判断
+
更新规则
+
输出

这为后面的:

Cognitive Method
Cognitive Class
Learning Engine

提供理论基础。


47.19 反馈学习的核心闭环

最终可以把本章压缩成:

          当前认知
             ↓
           决策
             ↓
           行为
             ↓
          环境
             ↓
           反馈
             ↓
       预期与实际比较
             ↓
           学习
             ↓
   ┌─────────┼──────────┐
   ↓         ↓          ↓
 经验       权重        记忆
   ↓         ↓          ↓
   └─────────┼──────────┘
             ↓
           先验
             ↓
         未来认知
             ↓
           决策

47.20 本章结论

第46章解决的是:

环境变化如何反馈给认知系统。

第47章进一步解决:

反馈如何改变未来的认知。

因此两者之间存在一个关键区别:

环境反馈
 ↓
当前状态更新

属于:

反馈响应

而:

环境反馈
 ↓
经验/记忆/权重/先验更新
 ↓
未来认知改变

属于:

反馈学习

最终可以形成:

反馈
 ↓
状态更新
 ↓
认知修正
 ↓
经验形成
 ↓
记忆保存
 ↓
权重调整
 ↓
先验变化
 ↓
未来认知变化

因此,本章的核心定义可以表述为:

反馈学习,是个体利用行为产生的环境反馈,对自身的经验、记忆、匹配权重和认知先验进行持续更新,使未来面对相似或相关状态时形成不同认知、决策与行为的过程。

由此,第十一篇正式开始。

第47章 反馈学习
       ↓
第48章 经验学习
       ↓
第49章 匹配权重学习
       ↓
第50章 个体认知变化
       ↓
第51章 行为与认知共同变化

而下一章要进一步回答的问题是:

如果反馈能够产生经验,那么个体究竟是如何从一次次具体事件中提取规律,并把“发生过的事情”转化为可以再次使用的经验?

Leave a Reply

Your email address will not be published. Required fields are marked *