第20章 多维认知匹配
当一个对象同时具有感觉、属性、状态、时间、位置、运动、因果和目标等多个维度时,机器不能再依靠单一条件进行认知,而必须在多个维度之间建立协同匹配。
第19章解决了一个基础问题:
认知不是静态匹配,而是随着对象状态和属性变化不断更新的动态匹配。
但是,动态匹配仍然只是解决了“变化”的问题。
现实中的对象并不是只有一个变化值。
一个人在拿起一个杯子的时候,他并不只是感知:
杯子
也不只是感知:
重量
而是在同时处理:
看到什么
摸到什么
是什么对象
具有什么属性
现在处于什么状态
在哪里
正在向哪里移动
为什么发生这种变化
我准备做什么
这些信息共同参与认知。
因此:
真正接近人的认知过程,不是单维匹配,而是多维认知匹配。
20.1 什么是多维认知匹配
多维认知匹配是指:
认知系统同时对来自不同维度的感知元素、对象属性、状态、时间、空间、运动、因果和目标等信息进行匹配,并通过这些维度之间的关系形成当前认知。
可以表示为:
感觉
+
属性
+
语义
+
逻辑
+
状态
+
时间
+
位置
+
运动
+
因果
+
目标
↓
多维匹配
↓
综合认知
这里有一个非常重要的变化:
以前可以认为:
一个输入
↓
一个匹配
↓
一个结果
而多维认知变成:
多个输入
↓
多个维度
↓
维度之间相互约束
↓
协同匹配
↓
综合状态
↓
认知
因此,多维认知匹配并不是把十种匹配简单地放在一起。
真正重要的是:
不同维度之间会相互影响、相互验证、相互修正。
20.2 为什么单一匹配无法形成完整认知
假设机器人看到一个物体。
视觉系统得到:
颜色 = 白色
形状 = 椭圆
仅凭视觉,可以得到:
可能是鸡蛋
但是这还不是完整认知。
如果加入触觉:
表面 = 光滑
硬度 = 较低
匹配强度增加。
如果加入重量:
重量 = 50g
进一步增加匹配。
如果加入位置:
位置 = 厨房桌面
又提供了环境信息。
如果加入运动:
对象 = 静止
系统又获得状态信息。
最终:
视觉
+
触觉
+
重量
+
位置
+
运动
共同指向:
对象 = 鸡蛋
所以:
认知不是某一个维度单独产生的,而是多个维度共同约束出来的。
20.3 感觉匹配
感觉匹配是多维匹配的基础。
它回答:
当前感知到的感觉是否与某个对象、属性或状态相符合?
例如:
视觉:
白色
椭圆
同时:
触觉:
光滑
再加:
压力:
较低
这些感觉信息共同参与对象匹配。
可以表示为:
Visual
+
Touch
+
Pressure
↓
Sensory Matching
20.3.1 感觉并不是对象本身
必须区分:
感觉
与:
对象
看到“白色”并不意味着:
白色 = 鸡蛋
摸到“光滑”也不意味着:
光滑 = 鸡蛋
感觉只是认知系统获得的输入元素。
因此:
感觉
↓
感知元素
↓
对象候选
↓
多维匹配
这是感知进入认知的重要过程。
20.4 属性匹配
属性匹配回答:
当前对象所表现出来的属性,是否与已有对象知识或当前任务要求相符合?
例如对象可能具有:
颜色
形状
重量
尺寸
硬度
温度
摩擦系数
承受能力
系统可以形成:
Current Attributes
↓
Known Attributes
↓
Attribute Matching
但属性匹配不能只比较单个属性。
例如:
重量 = 50g
只能说明对象比较轻。
而:
重量 = 50g
+
形状 = 椭圆
+
表面 = 光滑
+
硬度 = 较低
则形成更强的对象判断。
因此:
属性匹配开始进入多属性协同匹配。
20.5 语义匹配
语义匹配解决的是:
当前对象、属性和状态在认知系统中“意味着什么”。
例如:
对象 = 鸡蛋
只是对象识别。
但是:
鸡蛋
+
易碎
+
食物
+
需要保护
就形成了更丰富的语义。
语义匹配可以把:
对象
↓
属性
↓
意义
连接起来。
例如:
玻璃
+
透明
+
硬
+
易碎
最终可以形成:
Glass
=
Fragile Object
这里的“易碎”不是单纯一个数值,而是一种认知意义。
20.6 逻辑匹配
逻辑匹配回答:
多个事实之间是否能够形成合理的逻辑关系?
例如:
对象 = 鸡蛋
并且:
形变增加
再加:
压力持续增加
系统可以进一步判断:
压力增加
→
形变增加
如果这种关系与已有知识一致,那么逻辑匹配增强。
可以表示为:
Fact A
+
Fact B
+
Relation
↓
Logical Matching
逻辑匹配的重要作用是:
把孤立的数据转化为关系。
例如:
压力 = 4
形变 = 0.5
只是两个数据。
而:
压力持续增加
→
形变持续增加
就成为一个动态关系。
20.7 状态匹配
第17章已经建立了对象动态状态。
到了多维匹配阶段,状态本身也成为一个重要匹配维度。
例如:
对象 = 鸡蛋
状态 = 稳定
如果当前观察到:
滑移增加
+
形变增加
那么:
当前状态
与:
稳定状态
之间的匹配开始下降。
系统可能形成:
Stable
↓
Unstable
因此状态匹配实际上是:
Current State
↕
Expected / Known State
20.8 时间匹配
时间匹配解决:
一个事件发生的时间是否符合当前认知。
例如:
接触
↓
受力
↓
稳定
这是合理的抓取时序。
但如果出现:
接触
↓
滑移
↓
严重形变
↓
突然稳定
系统就需要判断这种时序是否合理。
时间本身不是一个普通属性。
它还决定:
不同状态之间应该如何连接。
因此:
State A
at t1
State B
at t2
State C
at t3
形成的是:
Temporal Relation
20.9 位置匹配
位置匹配回答:
对象在哪里,以及这个位置是否与当前认知相符合。
例如:
对象 = 鸡蛋
位置 = 厨房桌面
如果系统过去的知识是:
鸡蛋通常位于厨房
那么位置匹配增强。
但是,如果发现:
鸡蛋
位置 = 地面
状态 = 破损
位置与状态组合起来又产生新的认知。
因此:
位置
+
对象
+
状态
往往必须联合判断。
20.10 运动匹配
运动匹配回答:
对象正在如何运动,以及这种运动是否符合当前状态和目标。
例如:
位置:
100 → 105 → 110
说明对象在移动。
进一步:
方向 = 右
速度 = 增加
系统可以形成:
Object is moving rightward
但是运动还必须与其他维度结合。
例如:
鸡蛋
+
向下运动
+
速度增加
与:
鸡蛋
+
向上运动
+
速度降低
具有不同的认知意义。
因此:
运动不是孤立的数据,而是对象状态变化的一部分。
20.11 因果匹配
因果匹配是多维认知中非常重要的一层。
它解决:
一个变化是否可能由另一个变化引起。
例如机器人抓鸡蛋:
压力增加
↓
接触力增加
↓
形变增加
系统可以建立:
Pressure
↓
Deformation
如果同时出现:
压力增加
+
摩擦下降
+
滑移增加
则可能形成:
Pressure Change
↓
Contact Condition Change
↓
Slip Risk
这里系统不只是看到三个变化。
而是在理解:
这些变化之间可能存在影响关系。
这使认知从:
知道发生了什么
进一步发展到:
理解为什么发生
20.12 目标匹配
目标匹配回答:
当前状态和当前行为是否正在满足个体目标。
例如机器人目标不是简单的:
抓住鸡蛋
而是:
抓住鸡蛋
+
不打破鸡蛋
+
保持稳定
那么当前行为就必须与这个目标进行匹配。
假设:
目标:
对象损伤最小
当前状态:
压力增加
+
形变增加
+
滑移仍然存在
那么:
Current State
与:
Goal State
之间的匹配下降。
于是系统应该调整行为。
所以:
目标不是认知之后才出现的东西,目标本身也参与认知匹配。
20.13 多维匹配不是简单相加
这是本章必须明确的一个原则。
不能简单理解为:
感觉匹配
+
属性匹配
+
语义匹配
+
逻辑匹配
+
状态匹配
+
时间匹配
+
位置匹配
+
运动匹配
+
因果匹配
+
目标匹配
=
认知
因为不同维度之间存在:
依赖
约束
影响
冲突
强化
修正
例如:
视觉判断:
鸡蛋
但是:
触觉:
硬度异常高
出现冲突。
系统就不能简单地把两个结果相加。
而应该继续判断:
视觉
↕
触觉
↕
对象属性
↕
知识
寻找冲突原因。
这就是:
多维匹配的协同机制。
20.14 多维匹配中的协同
可以建立一个基本模型:
S = {
Sensory,
Attribute,
Semantic,
Logical,
State,
Time,
Position,
Motion,
Causal,
Goal
}
每一个维度产生自己的匹配状态:
M_sens
M_attr
M_sem
M_logic
M_state
M_time
M_position
M_motion
M_causal
M_goal
但最终不能直接机械相加。
而是通过关系形成:
M_sens
↕
M_attr
↕
M_state
↕
M_motion
↕
M_causal
↕
M_goal
最终形成:
Integrated Matching State
也就是:
综合认知匹配状态。
20.15 多维匹配中的冲突
真实认知系统必然会出现冲突。
例如:
视觉:
对象像鸡蛋
触觉:
硬度不像鸡蛋
重量:
符合鸡蛋
位置:
符合鸡蛋
运动:
符合鸡蛋
这时不能立即得到:
对象 = 鸡蛋
而应该形成:
候选认知
+
冲突
+
重新匹配
因此:
多维匹配
不仅用于确认,也用于:
发现认知冲突。
20.16 多维匹配中的权重
不同场景中,不同维度的重要程度不同。
例如判断一个物体是什么:
视觉
+
形状
+
尺寸
可能更加重要。
但是判断抓取是否安全:
压力
+
摩擦
+
滑移
+
形变
可能更加重要。
因此:
匹配权重必须随任务和状态变化。
例如:
Object Recognition:
Visual = 高
Shape = 高
Color = 中
Pressure = 低
而:
Grasp Safety:
Pressure = 高
Friction = 高
Slip = 高
Deformation= 高
Color = 低
这说明:
认知不是所有数据永远具有相同的重要程度。
20.17 多维匹配与动态权重
进一步地,权重本身也可以动态变化。
例如机器人刚接触鸡蛋:
Position
+
Contact
比较重要。
当机器人开始施力:
Pressure
+
Friction
重要性提高。
当鸡蛋开始移动:
Slip
+
Motion
重要性提高。
当出现形变:
Deformation
重要性进一步提高。
因此:
Weight(t)
本身也是动态的。
这为第24章“匹配权重”和第25章“动态权重”提供基础。
20.18 多维匹配与个体认知
到了这里,个体认知开始真正进入匹配体系。
因为不同个体面对相同对象时:
感觉相同
对象相同
属性相同
并不一定产生完全相同的认知。
例如:
个体A:
目标 = 保护对象
个体B:
目标 = 快速完成任务
那么同一个状态:
压力继续增加
可能得到不同的认知权重。
个体A可能认为:
风险正在增加
而个体B可能认为:
抓取速度可以继续提高
所以:
多维匹配
+
个体目标
+
个体经验
+
个体记忆
最终会形成:
Individual Cognition
这也是本书后面“个体认知理论”的基础。
20.19 鸡蛋抓取中的多维认知匹配
现在将十种匹配放入同一个工程场景。
机器人面对鸡蛋。
感觉匹配
视觉
触觉
压力
确认对象与接触状态。
属性匹配
重量
硬度
表面
承受能力
判断对象特征。
语义匹配
鸡蛋
→
易损对象
逻辑匹配
压力增加
→
形变增加
状态匹配
稳定
→
不稳定
时间匹配
接触
→
施力
→
稳定
位置匹配
鸡蛋
→
机械手当前位置
运动匹配
机械手运动
↔
鸡蛋运动
因果匹配
施力
→
形变
目标匹配
完成抓取
+
最小损伤
最终形成:
感觉
+
属性
+
语义
+
逻辑
+
状态
+
时间
+
位置
+
运动
+
因果
+
目标
↓
多维动态协同匹配
↓
当前认知状态
20.20 从“识别对象”到“理解情境”
单一对象识别只能得到:
这是鸡蛋。
多维认知可以进一步得到:
这是鸡蛋
+
它是易损对象
+
当前正在被抓取
+
当前压力正在增加
+
形变正在增加
+
滑移仍然存在
+
当前抓取状态正在恶化
+
继续增加压力可能导致损伤
+
当前目标是完成抓取并尽可能减少损伤
这已经不是:
对象识别。
而是:
情境认知。
因此,多维匹配使认知系统从:
What
逐渐发展到:
What
+
What Property
+
What State
+
What Change
+
Where
+
When
+
How
+
Why
+
For What
即:
是什么
+
具有什么
+
处于什么状态
+
发生了什么变化
+
在哪里
+
什么时候
+
如何变化
+
为什么变化
+
为了什么
20.21 多维认知匹配的工程结构
如果进入工程实现,多维匹配可以形成如下结构:
Current Perception
│
┌───────────────┼────────────────┐
↓ ↓ ↓
Sensory Object Context
│ │ │
↓ ↓ ↓
Attribute State Position
│ │ │
└───────────────┼────────────────┘
↓
Dynamic Relations
↓
┌────────┼────────┐
↓ ↓ ↓
Time Motion Causal
│ │ │
└────────┼────────┘
↓
Goal
↓
Multi-Dimensional
Matching
↓
Integrated Cognition
这个结构说明:
认知匹配不是一个简单的比较函数,而是一个多维状态组织过程。
20.22 多维匹配的核心原则
本章可以确立六条原则。
第一,认知必须多维
单一数据不能代表完整认知。
第二,维度之间必须建立关系
不是把数据堆在一起,而是理解它们之间的关联。
第三,匹配必须动态
对象变化以后,认知必须更新。
第四,匹配权重必须适应任务
不同任务关注不同维度。
第五,冲突本身也是认知信息
不同维度出现矛盾时,系统不能直接忽略。
第六,最终认知必须服务于目标
认知不是为了得到更多数据,而是为了:
理解当前状态
↓
判断可能结果
↓
选择合适行为
20.23 本章小结
第20章从第19章的动态匹配进一步发展出多维认知匹配。
认知系统需要同时处理:
感觉匹配
属性匹配
语义匹配
逻辑匹配
状态匹配
时间匹配
位置匹配
运动匹配
因果匹配
目标匹配
这些维度不是相互独立的。
它们会形成:
感觉
↓
属性
↓
状态
↓
时间
↓
位置
↓
运动
↓
因果
↓
目标
同时又通过:
语义
+
逻辑
进行更高层次的解释。
最终形成:
多维信息
↓
动态关系
↓
协同匹配
↓
综合状态
↓
认知
因此,本章最终建立一个核心认识:
机器真正需要模拟的,不是人的某一个感知通道,而是人在多个维度之间进行持续关联、比较、验证、修正和选择的认知过程。
而下一章将进一步解决一个更关键的问题:
当对象同时具有多个属性,并且这些属性又在同时发生变化时,系统如何把多个属性组织成一个整体进行协同匹配?
这将进入第21章——属性协同匹配。