第131章 Scene
场景
前面的认知结构已经逐层建立:
Perception
↓
Element
↓
Object
↓
Attribute
↓
Relation
↓
Dynamic Relation
到这里,机器已经能够理解:
一个元素是什么
一个对象是什么
对象具有什么属性
对象之间有什么关系
关系正在如何变化
但现实世界并不是由孤立的 Object 和 Relation 组成的。
机器真正面对的是:
一个房间
一张桌子
一个鸡蛋
一只手
一个机器人
周围的墙壁
当前的位置
当前的状态
正在发生的变化
这些信息共同形成:
Scene
因此,本章第一次建立完整的:
Scene Cognition
131.1 什么是 Scene
可以定义:
Scene 是认知系统在特定时间与空间范围内,对多个 Elements、Objects、Attributes、Relations、States 以及 Environment 进行统一组织后形成的整体认知结构。
最基本结构:
Scene
├── Elements
├── Objects
├── Attributes
├── Relations
├── States
└── Environment
因此:
Scene
=
Objects
+
Relations
+
States
+
Environment
但完整的 Scene 还必须保留:
Elements
+
Attributes
因为 Scene 不是直接从 Object 开始产生的。
完整认知链:
Perception
↓
Elements
↓
Objects
↓
Attributes
↓
Relations
↓
States
↓
Scene
131.2 Scene 不是图片
这是本章最重要的定义。
传统计算机视觉很容易把 Scene 理解为:
Image
例如:
Camera
↓
Image
图像里可能看到:
Table
Egg
Hand
Robot
但是:
Image ≠ Scene
因为一张图片只是:
Visual Projection
而 Scene 是:
Cognitive Structure
例如图片中看到:
Hand
Egg
Table
真正的 Scene 可能是:
Hand
↓ approaching
Egg
↓ supported_by
Table
以及:
Robot
↓ near
Table
所以:
Image 描述“看到了什么”,Scene 描述“当前世界是什么结构”。
131.3 Scene 是多元认知结构
第125章已经建立:
Multivariate Perception
一个现实对象不是单个数据值。
例如:
Egg
├── Position
├── Orientation
├── Distance
├── Velocity
├── Contact
├── Force
├── Fragility
└── Obstacle Context
这些信息进入:
Object
之后,与其他对象组合:
Egg
Hand
Table
Robot
再通过:
Relations
连接起来。
最终形成:
Scene
因此:
Multivariate Perception
↓
Multivariate Objects
↓
Relational Structure
↓
Scene
131.4 Scene 的空间范围
Scene 必须具有:
Spatial Boundary
例如:
Room Scene
可能包括:
Wall
Floor
Table
Chair
Egg
Robot
但同一个现实世界,也可以形成:
Table Scene
只关注:
Table
Egg
Cup
Hand
甚至:
Egg Interaction Scene
只关注:
Egg
Hand
Table
因此:
Scene 不是世界本身,而是认知系统在某一空间范围内选取和组织的一部分世界。
131.5 Scene 的时间范围
Scene 同样具有:
Temporal Boundary
例如:
Scene(t1)
可能是:
Egg on Table
Hand Far
而:
Scene(t2)
变成:
Egg on Table
Hand Near
再到:
Scene(t3)
变成:
Hand Contact Egg
因此:
Scene(t)
才是真正的动态场景模型。
可以表示为:
Scene
=
Spatial Context
+
Temporal State
131.6 Scene 的基本结构
可以建立:
Scene
{
id,
timestamp,
elements,
objects,
attributes,
relations,
states,
environment
}
进一步:
Scene
{
id,
spatial_scope,
temporal_scope,
elements,
objects,
attributes,
relations,
states,
environment,
events,
confidence
}
其中:
elements
来自:
Perception
objects
来自:
Element → Object
relations
来自:
Object → Object
而:
states
来自:
Object + Relation + Time
131.7 Scene Elements
Scene 的最底层仍然保留:
Elements
例如:
Edge
Color
Sound
Pressure
Temperature
Motion Signal
Contact Signal
这些并不一定都已经形成 Object。
例如:
声音
可能只是:
Sound Element
系统暂时无法确定:
Who produced it?
所以:
Scene
├── Known Objects
└── Raw / Unresolved Elements
非常重要。
这意味着 Scene 不要求所有感知数据都已经被完全理解。
131.8 Scene Objects
Scene 中的 Object 是:
Recognized Cognitive Object
例如:
Scene
├── Egg
├── Table
├── Hand
├── Robot
└── Cup
每一个 Object 都拥有:
Attributes
Relations
State
例如:
Egg
├── Shape = Oval
├── Fragility = High
├── Position = P1
├── State = Supported
└── Relations
因此 Scene 是多个 Object 的统一容器。
131.9 Scene Attributes
Scene 不只有 Object Attribute。
还存在:
Scene-level Attributes
例如:
Lighting
Temperature
NoiseLevel
Visibility
Crowding
TimeOfDay
这些属性并不属于单独的 Object。
例如:
Lighting = Low
不是:
Egg.Lighting
而是:
Scene.Lighting
因此:
Object Attribute
和:
Scene Attribute
必须区分。
131.10 Scene Relations
Scene 中所有 Object Relation 可以组成:
Relation Network
例如:
Hand
↓ approaching
Egg
↓ supported_by
Table
Robot
↓ near
Table
于是:
Scene.Relations
可以表示:
R1 = Approaching(Hand,Egg)
R2 = SupportedBy(Egg,Table)
R3 = Near(Robot,Table)
这使 Scene 成为:
Object Graph
而不是:
Object List
131.11 Scene States
Scene 还必须记录:
Current States
例如:
Egg = Supported
Hand = Approaching
Robot = Moving
Door = Open
Table = Stable
这些 State 可以来自:
Object State
+
Relation State
+
Environment State
因此:
Scene States
├── Object States
├── Relation States
└── Environment States
131.12 Environment
Environment 是 Scene 的重要组成部分。
例如:
Environment
├── Room
├── Floor
├── Wall
├── Lighting
├── Temperature
├── Obstacles
└── Background Conditions
它与 Object 的区别在于:
Object
通常是 Scene 中具有独立认知身份的实体。
而:
Environment
描述对象所处的:
Context
例如:
Egg
是 Object。
而:
Room
可以作为 Environment。
但环境本身也可能被系统进一步建模为 Object。
因此:
Environment 是一种认知角色,而不一定是绝对固定的数据类型。
131.13 Scene Context
同一个 Object 在不同 Scene 中意义可能完全不同。
例如:
Egg
在:
Kitchen Scene
可能表示:
Food Object
在:
Laboratory Scene
可能表示:
Experimental Object
因此:
Object
需要:
Scene Context
才能获得完整的认知意义。
结构:
Object
+
Scene Context
↓
Contextual Meaning
131.14 Scene 与 Context
可以进一步建立:
Scene
↓
Context
例如:
Kitchen
提供:
Food
Cooking
Table
Utensils
相关背景。
而:
Workshop
提供:
Tools
Machines
Materials
Work Surfaces
相关背景。
因此:
Scene 为 Object 提供认知上下文。
131.15 Scene 是 Object 的集合,但不只是集合
如果:
Scene = Objects
那么:
Scene
=
Egg
+
Hand
+
Table
这远远不够。
因为系统还不知道:
Hand 与 Egg 什么关系?
Egg 与 Table 什么关系?
当前发生了什么?
环境是什么?
对象正在怎么变化?
因此正确模型:
Scene
=
Objects
+
Attributes
+
Relations
+
States
+
Environment
进一步:
Scene
=
Elements
+
Objects
+
Attributes
+
Relations
+
States
+
Environment
131.16 Scene 是结构
因此 Scene 的本质不是:
Collection
而是:
Structure
例如:
Scene
│
├── Object: Table
│
├── Object: Egg
│
├── Object: Hand
│
├── Relation:
│ Egg → SupportedBy → Table
│
├── Relation:
│ Hand → Approaching → Egg
│
├── State:
│ Egg = Stable
│
└── Environment:
Kitchen
这里每一部分都相互连接。
131.17 Scene Graph
因此可以形成:
Scene Graph
例如:
Kitchen
│
┌───────┴───────┐
↓ ↓
Table Robot
│ │
near near
│ │
Egg ─────────── Hand
↑ │
│ approaching
supported_by │
│ ↓
└──────────── Egg
更加严格地:
Nodes
=
Objects
Edges
=
Relations
而 Scene Graph 是:
Object Graph
+
Environment Context
131.18 Dynamic Scene
因为 Relation 是动态的:
Scene
自然也是动态的。
定义:
Scene(t)
例如:
t1
Hand ──Far──> Egg
Egg ──SupportedBy──> Table
t2
Hand ──Approaching──> Egg
Egg ──SupportedBy──> Table
t3
Hand ──Contact──> Egg
Egg ──SupportedBy──> Table
t4
Hand ──Holding──> Egg
Egg ──Leaving──> Table
于是:
Scene(t1)
↓
Scene(t2)
↓
Scene(t3)
↓
Scene(t4)
形成:
Dynamic Scene
131.19 Scene Change
两个时间点之间:
Scene(t1)
和:
Scene(t2)
可以比较:
ΔScene
例如:
Object Added
Object Removed
Attribute Changed
Relation Created
Relation Ended
State Changed
Environment Changed
因此:
ΔScene
就是:
Scene Change
131.20 Scene Change Detection
可以建立:
Scene(t-1)
+
Scene(t)
↓
Scene Comparison
↓
Scene Change
例如:
t1:
Egg on Table
t2:
Egg in Hand
系统发现:
Relation:
SupportedBy(Egg,Table)
消失。
同时:
Relation:
Holding(Hand,Egg)
建立。
于是:
Scene Change
可以表达:
Egg transferred
from
Table
to
Hand
这比单纯的 Object Detection 高很多层。
131.21 Scene Event
Scene Change 可以进一步产生:
Event
例如:
Relation Change
↓
Scene Change
↓
Event
例如:
Approaching
↓
Contact
形成:
Contact Event
又例如:
SupportedBy(Egg,Table)
↓
Ended
Holding(Hand,Egg)
↓
Created
形成:
Pickup Event
因此:
Scene
成为 Event Detection 的重要基础。
131.22 Scene 与 Behavior
行为并不一定存在于单个 Object 中。
例如:
Pickup
需要:
Hand
+
Egg
+
Table
以及:
Approaching
+
Contact
+
Holding
+
SupportedBy Change
所以:
Behavior
实际上是:
Scene Change Pattern
可以表示:
Scene(t1)
↓
Scene(t2)
↓
Scene(t3)
↓
Scene(t4)
通过连续 Scene 状态变化识别:
Pickup
Place
Push
Pull
Open
Close
Move
131.23 Scene 与 Situation
需要进一步区分:
Scene
和:
Situation
Scene 更偏向:
当前世界结构
Situation 更偏向:
当前具有认知意义的状态组合
例如:
Scene:
Room
Table
Egg
Hand
Robot
而:
Situation:
Hand is about to pick up Egg
所以:
Scene
↓
Situation Recognition
Scene 提供:
World Structure
Situation 提供:
Meaningful Current Configuration
131.24 Scene 与 Environment 的关系
可以定义:
Scene
├── Local Objects
├── Relations
├── States
└── Environment Context
例如:
Kitchen Scene
包含:
Environment:
Kitchen
Objects:
Table
Egg
Hand
Cup
Relations:
Egg On Table
Hand Near Egg
States:
Egg Stable
Hand Moving
因此 Environment 是 Scene 的背景条件。
131.25 Scene Identity
Scene 本身也需要一个:
Scene ID
例如:
S001
因为机器需要知道:
当前是哪一个 Scene?
例如:
S001 = Kitchen Table Interaction
S002 = Doorway Navigation
S003 = Robot Charging
因此:
Scene
{
id
}
是必要的。
131.26 Scene Boundary
Scene 还需要:
Boundary
例如:
Spatial Boundary
定义:
X
Y
Z
范围。
也可以是:
Semantic Boundary
例如:
Kitchen Area
或:
Robot Workspace
因此 Scene 不一定只由几何范围定义。
可以存在:
Geometric Scene
和:
Semantic Scene
131.27 Scene Observation
Scene 不一定是绝对真实世界。
机器看到的是:
Observed Scene
因此应该区分:
World
与:
Observed Scene
例如:
真实世界:
Egg 在 Table 后面
Camera:
看不到 Egg
那么机器的 Scene 可能:
Table
Hand
Robot
但:
Egg = Unknown / Occluded
因此:
Scene 是当前认知系统对世界的可观测模型,而不是世界本身。
这是非常重要的认知边界。
131.28 Scene Confidence
Scene 中不同部分可以拥有不同可信度:
Egg
Confidence = 0.98
但:
Contact(Hand,Egg)
Confidence = 0.62
或者:
Object Identity
Confidence = 0.75
因此:
Scene Confidence
不是一个简单的单值。
更合理的是:
Element Confidence
Object Confidence
Relation Confidence
State Confidence
分别存在。
131.29 Scene Memory
Scene 也可以进入记忆。
例如:
Scene Memory
记录:
S001
Kitchen
10:30
Egg on Table
Hand approaching
之后:
S002
Kitchen
10:31
Egg held by Hand
于是系统可以比较:
S001
vs
S002
得到:
Scene Transition
这使 Scene 成为:
Cognitive Memory
的重要单位。
131.30 Scene Prediction
如果机器拥有:
Current Scene
+
Dynamic Relations
+
History
就可以预测:
Future Scene
例如:
Current:
Hand Approaching Egg
预测:
Future:
Hand Contact Egg
再预测:
Future:
Egg Held
所以:
Scene(t)
+
Relation Dynamics
↓
Scene(t+1)
形成:
Scene Prediction
131.31 Scene 与 Decision
决策不应该只根据一个 Object。
例如:
Egg
Fragility = High
本身不能决定:
Robot 应该怎么做。
还需要:
Hand Position
Table Position
Obstacle
Robot State
Egg State
Environment
共同形成:
Current Scene
然后:
Scene
↓
Situation
↓
Risk
↓
Decision
因此:
Decision 的真实输入不是单个 Object,而是当前 Scene。
131.32 Scene 的层级
可以进一步建立 Scene 层级:
World
↓
Environment
↓
Scene
↓
SubScene
↓
Object
例如:
House
↓
Kitchen
↓
Table Area
↓
Egg Interaction Area
↓
Egg
因此一个 Scene 可以包含:
SubScenes
例如:
Kitchen Scene
├── Cooking SubScene
├── Dining SubScene
└── Cleaning SubScene
131.33 Scene 与多个视角
同一个 Scene 可以由多个 Perception Source 共同构建:
Camera A
Camera B
Depth Sensor
Microphone
Force Sensor
共同输入:
Scene Builder
形成:
Unified Scene
因此:
Perception
├── Vision
├── Audio
├── Touch
├── Force
└── Temperature
↓
Scene Fusion
↓
Scene
这与第125章的:
Multivariate Perception
进一步统一。
131.34 Scene Fusion
多源感知可能产生:
Vision:
Hand Near Egg
Depth:
Distance = 4cm
Force:
Contact = TRUE
系统融合:
Vision
+
Depth
+
Force
得到:
Scene Relation:
Hand Contact Egg
因此:
Scene
是一个:
Multi-Source Cognitive Structure
而不是某一个传感器的直接输出。
131.35 Scene Builder
工程上可以建立:
Scene Builder
数据流:
Perception
↓
Element Extraction
↓
Object Construction
↓
Attribute Update
↓
Relation Construction
↓
State Evaluation
↓
Environment Modeling
↓
Scene Builder
↓
Current Scene
输出:
Scene(t)
131.36 Scene Update
每一个新的感知周期:
Perception(t)
都可以更新:
Scene(t-1)
得到:
Scene(t)
即:
Scene(t)
=
Update(
Scene(t-1),
Perception(t)
)
这意味着 Scene 是:
Persistent Cognitive State
而不是一次性生成的对象。
131.37 Scene State Machine
Scene 自身也可以拥有状态:
Unknown
↓
Observed
↓
Constructed
↓
Stable
↓
Changing
↓
Updated
例如:
Scene
最初:
Unknown
传感器获得数据:
Observed
对象与关系建立:
Constructed
环境稳定:
Stable
手进入场景:
Changing
系统重新计算:
Updated
因此 Scene 也属于:
Stateful Cognitive Structure
131.38 Scene 的核心数学表示
可以定义:
Scene(t)
=
{
E(t),
O(t),
A(t),
R(t),
S(t),
Env(t)
}
其中:
E(t) = Elements
O(t) = Objects
A(t) = Attributes
R(t) = Relations
S(t) = States
Env(t) = Environment
因此:
Scene(t)
是某一时间点的完整认知快照。
但是它不是静态图片。
它是:
Cognitive State Snapshot
131.39 Scene Evolution
连续时间:
Scene(t1)
↓
Scene(t2)
↓
Scene(t3)
↓
Scene(t4)
形成:
Scene Evolution
因此可以建立:
Scene History
即:
S(t1)
S(t2)
S(t3)
S(t4)
...
进一步:
Scene History
↓
Scene Transition
↓
Behavior / Event
131.40 Scene Transition
两个 Scene 之间存在:
SceneTransition
例如:
Scene A:
Egg on Table
↓
Scene B:
Egg Held by Hand
Transition 可以记录:
Objects Changed
Relations Changed
States Changed
Environment Changed
例如:
Relation Removed:
SupportedBy(Egg,Table)
Relation Added:
Holding(Hand,Egg)
于是:
Scene A
↓
Transition
↓
Scene B
这为行为理解提供结构化基础。
131.41 Scene 与 Cognition
至此:
Element
回答:
感知到了什么基础信号?
Object
回答:
这个东西是什么认知实体?
Attribute
回答:
它有什么性质?
Relation
回答:
它与其他对象是什么关系?
Dynamic Relation
回答:
关系正在如何变化?
而:
Scene
回答:
这些对象、属性、关系、状态和环境当前共同构成了什么世界结构?
因此 Scene 是一个重要的认知跃迁。
131.42 从 Object Cognition 到 Scene Cognition
之前:
Object Cognition
主要关注:
Egg
现在:
Scene Cognition
关注:
Egg
+
Hand
+
Table
+
Robot
+
Environment
+
Relations
+
States
于是:
Object
↓
Object Network
↓
Scene
形成:
Local World Model
131.43 Scene 的完整认知模型
最终可以建立:
Scene
│
├── Elements
│ ├── Visual
│ ├── Audio
│ ├── Touch
│ ├── Force
│ └── Other Signals
│
├── Objects
│ ├── Object A
│ ├── Object B
│ └── Object C
│
├── Attributes
│ ├── Stable
│ └── Dynamic
│
├── Relations
│ ├── Spatial
│ ├── Physical
│ ├── Motion
│ └── Functional
│
├── States
│ ├── Object States
│ ├── Relation States
│ └── Environment States
│
└── Environment
├── Space
├── Lighting
├── Temperature
├── Obstacles
└── Context
这第一次形成完整的:
Cognitive Scene Model
131.44 Scene 的动态模型
进一步:
Scene(t)
│
┌──────────────┼──────────────┐
↓ ↓ ↓
Objects Relations Environment
│ │ │
Attributes Dynamics Conditions
│ │ │
└──────────────┼──────────────┘
↓
Scene State
↓
Scene Change
↓
Scene Transition
↓
Event / Behavior
所以 Scene 不再是:
Image
而是:
Dynamic Cognitive World State
131.45 Scene 的核心定义
Scene 是机器在特定空间与时间范围内,将 Elements、Objects、Attributes、Relations、States 与 Environment 组织成统一结构后形成的动态认知世界模型。
核心结构:
Scene
├── Elements
├── Objects
├── Attributes
├── Relations
├── States
└── Environment
核心动态:
Scene(t)
↓
Scene(t+1)
↓
Scene Change
核心关系:
Objects
↓
Relations
↓
Dynamic Relations
↓
Scene
核心认知链:
Perception
↓
Element
↓
Object
↓
Attribute
↓
Relation
↓
Dynamic Relation
↓
Scene
最终形成:
COGNITIVE SCENE
│
┌──────────────┼──────────────┐
↓ ↓ ↓
Elements Objects Environment
│
┌──────┴──────┐
↓ ↓
Attributes States
│ │
└──────┬──────┘
↓
Relations
↓
Dynamic Relations
↓
Scene Change
↓
Situation
↓
Event
↓
Behavior
因此,本章完成了一个非常关键的认知跃迁:
Element
是:
感知世界的基础单位。
Object
是:
被组织起来的认知实体。
Relation
是:
对象之间的结构连接。
Dynamic Relation
是:
对象关系的时间变化。
而:
Scene
则是:
多个动态对象及其关系、状态和环境在特定时空中的统一认知结构。
所以:
Scene ≠ Image
Scene ≠ Object List
Scene ≠ Relation List
而是:
Scene
=
Elements
+
Objects
+
Attributes
+
Relations
+
States
+
Environment
+
Time
由此,WSaiOS-ICAI 第一次拥有了真正意义上的:
World Representation
机器开始从:
“我看到了什么?”
进入:
“当前世界是什么状态?”
而下一步自然出现更深的问题:
如果 Scene 是一个动态世界结构,那么机器如何从当前 Scene 中识别“正在发生的事情”?
这将把:
Scene
↓
Scene Change
进一步推进到:
Scene
↓
Situation
↓
Event
即下一阶段的 Situation Cognition / Event Cognition。