第46章 环境反馈认知
前面已经建立了完整的行为链:
感知
↓
认知
↓
决策
↓
行为
↓
环境变化
但如果到“环境变化”就结束,那么整个认知系统实际上仍然是一个单向系统。
人并不是这样工作的。
人在实施行为之后,会继续观察行为造成的结果,并根据新的结果重新判断对象、环境和自身状态。也就是说:
行为改变环境,环境变化又通过反馈改变认知。
因此,认知过程不是一条直线,而是一个持续循环的闭环。
感知
↓
认知
↓
决策
↓
行为
↓
环境变化
↓
反馈
↓
再次感知
↓
再次认知
46.1 什么是环境反馈
所谓环境反馈,是指:
个体实施行为之后,环境、对象或行为结果产生新的变化,并将这些变化重新提供给认知系统。
这里的环境不是单纯指物理空间。
它可以包括:
- 外部环境
- 被作用的对象
- 其他对象
- 其他个体
- 自身身体状态
- 工具状态
- 任务状态
- 时间状态
例如,一个人拿起一个鸡蛋。
开始时,认知系统可能认为:
对象:鸡蛋
状态:静止
任务:拿起
风险:低
随后开始抓取:
手指接触鸡蛋
↓
压力增加
↓
鸡蛋移动
↓
摩擦产生
↓
位置发生变化
这些变化并不会停留在环境中,而会重新进入感知系统。
于是:
环境变化
↓
新的感觉
↓
新的感知元素
↓
新的对象状态
这就是环境反馈。
46.2 行为不是认知的终点
如果把行为定义成认知过程的最后一步,那么系统可以表示为:
输入
↓
认知
↓
输出
这种模型适合描述一次性的计算过程,却不能很好描述人的持续行为。
人的行为通常是:
判断
↓
行动
↓
观察结果
↓
重新判断
↓
调整行动
↓
再次观察
例如:
手靠近杯子
↓
观察杯子位置
↓
调整手的位置
↓
接触杯子
↓
感受压力
↓
判断是否抓稳
↓
调整手指压力
这里没有真正意义上的“结束”。
每一个行为都可能产生新的感觉和新的认知。
因此:
行为不是认知过程的终点,而是下一轮认知的触发条件。
46.3 环境反馈首先改变对象状态
行为作用于环境之后,最直接产生变化的通常是对象状态。
例如:
抓取前:
Object.State = Stable
开始抓取:
Pressure ↑
继续运动:
Position → Change
Velocity → Change
如果出现滑移:
Slip ↑
那么对象状态可能由:
Stable
变为:
Unstable
因此:
行为
↓
属性变化
↓
状态变化
可以写成:
State(t)
↓
Behavior(t)
↓
Attribute(t+1)
↓
State(t+1)
对象状态因此不是固定的。
它是一个随着行为和环境变化不断更新的认知对象。
46.4 环境反馈重新进入感知系统
环境发生变化之后,认知系统必须重新获得这些变化。
因此反馈首先表现为新的感知:
环境变化
↓
视觉变化
触觉变化
压力变化
声音变化
空间变化
时间变化
↓
新的感知信息
例如鸡蛋抓取:
压力变化
↓
触觉反馈
位置变化
↓
视觉反馈
滑移变化
↓
视觉 + 触觉反馈
形变变化
↓
视觉反馈
这些反馈最终形成新的感知元素:
Element₁
Element₂
Element₃
...
再进入对象、属性和状态系统。
所以可以形成:
环境
↓
感觉
↓
感知
↓
元素
↓
对象
↓
属性
↓
状态
这与前面的感知理论重新连接起来。
46.5 反馈不是简单的成功或失败
环境反馈不能简单理解成:
成功
或者:
失败
真实环境中的反馈往往是多维的。
例如一次鸡蛋抓取可能得到:
任务:完成
位置:正确
压力:偏高
摩擦:正常
滑移:轻微
形变:未发现
稳定性:下降
因此一次行为可能同时产生:
正向反馈
+
负向反馈
+
中性反馈
例如:
任务完成
说明行为达到了任务目标。
但:
压力偏高
说明行为仍然存在风险。
因此认知系统不能只问:
“成功了吗?”
而应该进一步问:
“行为产生了什么变化?”
以及:
“这些变化意味着对象和环境现在处于什么状态?”
46.6 反馈重新触发认知匹配
第18章已经建立了认知匹配:
对象
+
属性
+
状态
+
关系
↓
认知匹配
环境反馈进入系统之后,这个过程必须重新执行。
因此:
原有状态
↓
行为
↓
环境变化
↓
新感知
↓
新属性
↓
新状态
↓
重新匹配
也就是说:
反馈实际上是下一轮认知匹配的输入。
因此完整认知过程可以表示为:
当前感知
↓
对象
↓
属性
↓
状态
↓
认知匹配
↓
认知
↓
决策
↓
行为
↓
环境变化
↓
反馈
↓
新的感知
↓
新的状态
↓
再次匹配
46.7 反馈能够改变匹配权重
反馈不仅改变当前状态,还可能改变下一次认知中的属性权重。
例如第一次抓取鸡蛋时:
压力
摩擦
滑移
形变
都参与匹配。
但是,如果反馈发现:
滑移明显增加
那么下一次认知时,系统可能更加关注:
滑移
于是:
反馈
↓
风险发现
↓
属性重要性变化
↓
匹配权重变化
↓
新的认知
因此前面第24章和第25章建立的:
匹配权重
动态权重
并不是孤立存在的。
它们可以受到环境反馈影响。
46.8 反馈能够改变认知概率
第26章建立了:
Dynamic Matching
↓
Matching Strength
↓
Dynamic Weight
↓
Probability
↓
Cognition
加入反馈之后,就形成:
行为
↓
反馈
↓
重新匹配
↓
匹配强度变化
↓
权重变化
↓
概率变化
↓
认知变化
例如原来的认知是:
对象稳定
Probability = 高
行为之后发现:
滑移增加
压力异常
那么系统就必须重新计算:
稳定概率 ↓
失稳概率 ↑
最终认知可能从:
对象稳定
变成:
对象存在失稳风险
因此:
反馈不仅改变状态,还能够改变认知结果的概率结构。
46.9 反馈产生认知修正
第一次认知不一定正确。
认知系统真正重要的能力之一,是能够利用现实反馈发现认知与现实之间的差异。
可以表示为:
预测状态
↓
执行行为
↓
获得反馈
↓
实际状态
↓
比较差异
↓
认知修正
例如:
原认知:
鸡蛋稳定
执行行为:
抓取
实际反馈:
出现滑移
系统发现:
预测 ≠ 实际
于是:
重新匹配
↓
风险提高
↓
认知修正
这说明:
认知并不是一次性确定的,而是可以被现实持续修正的。
46.10 反馈与个体经验
如果某种反馈只出现一次,它主要影响当前认知。
如果相同反馈反复出现,它就可能形成经验。
例如某个个体多次发现:
压力增加
+
摩擦降低
+
滑移增加
往往意味着:
对象即将失稳
那么这种关系就可能形成个体经验:
反馈
↓
重复出现
↓
经验形成
↓
经验保存
↓
下一次认知调用
因此:
环境反馈是个体经验形成的重要来源。
这也把本章与第28章“个体经验”连接起来。
46.11 反馈与个体差异
即使面对完全相同的环境反馈,不同个体也可能产生不同认知。
例如两个人都看到:
对象发生轻微滑移
个体A:
过去有相关经验
↓
判断风险较高
↓
立即调整行为
个体B:
缺少相关经验
↓
认为仍然稳定
↓
继续当前行为
因此:
相同反馈
+
不同经验
+
不同记忆
+
不同先验
+
不同偏差
+
不同目标
↓
不同权重
↓
不同概率
↓
不同个体认知
这说明环境反馈本身并不能直接决定认知。
它必须经过个体认知结构的解释。
46.12 从一次反馈到连续反馈
人的认知反馈通常不是一次性的。
更常见的是:
行为
↓
反馈
↓
调整
↓
行为
↓
反馈
↓
调整
↓
行为
↓
……
因此整个认知系统实际上是一个持续循环:
┌──────────────┐
↓ │
感知 │
↓ │
认知 │
↓ │
决策 │
↓ │
行为 │
↓ │
环境变化 │
↓ │
反馈 ────────────┘
这就是:
认知—决策—行为—反馈闭环。
46.13 反馈与状态更新
从理论工程角度看,反馈最终必须转化为状态更新。
可以建立:
Feedback
↓
Perception
↓
Element Update
↓
Object Update
↓
Attribute Update
↓
State Update
↓
Matching
↓
Cognition
因此一个认知系统不仅需要:
Object
Attribute
State
还必须存在:
Update
因为:
没有状态更新,就没有真正的动态认知。
一个只能定义对象初始状态、却不能根据现实变化更新状态的系统,只能描述静态世界,而不能模拟人的连续认知。
46.14 环境反馈形成认知闭环
至此,本篇前面的理论可以连接起来:
感觉
↓
感知
↓
元素
↓
对象
↓
属性
↓
动态属性
↓
关系
↓
动态状态
↓
认知匹配
↓
认知
↓
决策
↓
行为
↓
对象/环境变化
↓
反馈
↓
新的感觉
形成完整闭环:
┌─────────────────────────────┐
│ ↓
感知 → 对象 → 属性 → 状态 → 匹配 → 认知
↑ ↓
│ 决策
│ ↓
└────── 反馈 ← 环境变化 ← 行为 ←────────┘
因此:
认知不是一个静态结果,而是一个不断受到现实反馈修正的动态过程。
46.15 从认知闭环进入认知学习
如果反馈只能改变当前状态,那么系统只能完成:
感知
↓
判断
↓
行为
↓
修正
如果反馈还能够进一步改变:
经验
记忆
先验
权重
那么系统就开始产生学习。
于是:
反馈
↓
当前状态更新
↓
认知修正
↓
经验积累
↓
权重变化
↓
下一次认知改变
这就从:
认知闭环
进入:
认知学习。
因此,第46章是整个“认知—决策—行为闭环”的最后一环,也是后面第十一篇“认知学习”的理论入口。
46.16 本章核心模型
环境反馈认知可以最终抽象为:
Current State
↓
Cognition
↓
Decision
↓
Behavior
↓
Environment Change
↓
Feedback
↓
New Perception
↓
New State
↓
Re-Matching
↓
New Cognition
进一步加入个体因素:
Feedback
↓
Experience
Memory
Prior
Bias
Goal
↓
Weight
↓
Probability
↓
Individual Cognition
最终形成:
感知
↓
对象
↓
属性
↓
状态
↓
认知匹配
↓
认知
↓
决策
↓
行为
↓
对象/环境变化
↓
反馈
↓
┌───────┴───────┐
↓ ↓
当前更新 个体学习
↓ ↓
新状态 经验/记忆/先验
↓ ↓
└───────┬───────┘
↓
再次匹配
↓
再次认知
本章结论
环境反馈不是认知过程的结束,而是下一次认知的开始。
更进一步:
当反馈能够改变对象状态、属性权重、认知概率以及个体经验、记忆和先验时,认知系统就从一次性的判断过程进入持续的动态认知过程,并最终形成认知学习。
至此,第43—46章形成完整闭环:
第43章 认知产生决策
↓
第44章 决策产生行为
↓
第45章 行为改变环境
↓
第46章 环境反馈认知
↓
再次认知
而下一篇将进一步回答:
如果反馈可以不断改变认知,那么这种变化究竟如何形成“学习”?