第7章 场景:Scene
在前六章中,结构化智能已经建立了从 Element → Object → Attribute → Relation → State 的基本结构。
但现实世界并不是一个孤立对象,也不是一个孤立状态。
现实通常表现为:
多个对象同时存在,并以一定关系处于某种共同状态之中。
因此,需要引入 Scene(场景)。
7.1 场景的构成
Scene 是在特定时间和环境条件下,由多个对象、对象属性、对象状态以及对象之间的关系共同构成的结构化现实单元。
可以定义:
Scene={O,A,R,S,C,T}Scene = \{O,A,R,S,C,T\}
其中:
- OO:Objects,对象集合
- AA:Attributes,属性集合
- RR:Relations,关系集合
- SS:States,状态集合
- CC:Context,环境与上下文
- TT:Time,时间
基本结构:
Scene
│
┌──────────────┼──────────────┐
↓ ↓ ↓
Objects Relations Context
│ │ │
┌───┼───┐ ┌───┼───┐ Environment
↓ ↓ ↓ ↓ ↓ ↓ Time
O1 O2 O3 R1 R2 R3
│ │ │
↓ ↓ ↓
State State State
因此,场景不是简单的“对象列表”。
真正的场景结构是:
Scene=Objects+Attributes+Relations+States+ContextScene= Objects+ Attributes+ Relations+ States+ Context
也就是说:
场景是现实在某一时刻的结构化截面。
7.2 场景不是对象集合
如果只有:
Robot
Box
Table
Human
这只能说明系统发现了四个对象。
还不能形成完整场景。
因为系统还不知道:
Robot 在哪里?
Box 在哪里?
Human 在哪里?
Box 是否在 Table 上?
Robot 是否正在抓取 Box?
Human 与 Robot 的距离是多少?
因此:
Object List
≠
Scene
只有加入关系和状态之后:
Robot
│
Near
↓
Box
│
On
↓
Table
Human
│
Near
↓
Robot
再结合当前状态:
Robot = Moving
Box = Static
Human = Standing
Table = Static
才形成真正的结构化场景。
因此:
Scene 的核心不是“有什么”,而是“有什么、彼此是什么关系、当前处于什么状态”。
7.3 多对象场景
现实世界通常是多对象系统。
可以定义:
O={O1,O2,…,On}O=\{O_1,O_2,\ldots,O_n\}
其中:
n≥1n\geq1
一个简单场景:
Scene01
Object:
Robot01
Box01
Table01
Human01
对象之间存在关系:
R={R1,R2,…,Rm}R=\{R_1,R_2,\ldots,R_m\}
例如:
On(Box01,Table01)On(Box01,Table01) Near(Robot01,Box01)Near(Robot01,Box01) Near(Human01,Robot01)Near(Human01,Robot01)
于是场景可以表示为一个结构:
Human01
│
Near
↓
Robot01
│
Near
↓
Box01
│
On
↓
Table01
因此,多对象场景本质上具有网络结构。
可以进一步表示为:
Scene=(V,E,S)Scene=(V,E,S)
其中:
- VV:对象节点
- EE:对象关系
- SS:对象及关系状态
这使 Scene 与图结构、知识图结构以及后续认知计算天然连接起来。
7.4 场景状态
单个对象具有 Object State。
多个对象及其关系共同形成 Scene State(场景状态)。
例如:
Scene01
Robot01:
Position = A
Velocity = 1m/s
Box01:
Position = B
State = Static
Human01:
Position = C
State = Walking
Relation:
Near(Robot01, Box01)
Near(Human01, Robot01)
这些信息共同构成:
Sscene(t)S_{scene}(t)
因此:
SceneState=F(Objects,Attributes,Relations,Context,Time)SceneState= F(Objects,Attributes,Relations,Context,Time)
场景状态不是简单地把所有对象状态相加。
它还包含:
对象之间关系所形成的整体条件。
例如:
Robot = Moving
Box = Static
Distance(Robot,Box)=20cm
可能形成:
Scene State:
Robot approaching Box
而当:
Distance = 2cm
场景状态可能变成:
Robot ready to interact with Box
所以:
场景状态是对象状态与关系状态共同形成的整体状态。
7.5 场景变化
现实世界不是静态场景。
场景会随时间不断变化:
Scene(t0)→Scene(t1)→Scene(t2)→…Scene(t_0) \rightarrow Scene(t_1) \rightarrow Scene(t_2) \rightarrow …
例如:
初始场景
Robot
↓
Far
↓
Box
变化
Robot → Moving
新场景
Robot
↓
Near
↓
Box
因此:
ΔScene=Scene(t1)−Scene(t0)\Delta Scene= Scene(t_1)-Scene(t_0)
场景变化可能来自多个层面:
Scene Change
├── Object Change
├── Attribute Change
├── State Change
├── Relation Change
├── Object Added
├── Object Removed
└── Environment Change
例如一个人走进房间:
t0:
Room
├── Table
└── Chair
t1:
Room
├── Table
├── Chair
└── Human
这里不仅是 Human 的状态变化,而是:
场景对象集合本身发生了变化。
因此:
O(t0)≠O(t1)O(t_0)\neq O(t_1)
同样,如果 Human 从门口走到桌边:
Near(Human,Door)
↓
Near(Human,Table)
对象没有增加或消失,但:
R(t0)≠R(t1)R(t_0)\neq R(t_1)
因此:
场景变化可以来自对象、属性、状态、关系或环境中的任何结构变化。
7.6 场景的时间连续性
场景同样具有连续性。
可以建立场景历史:
HScene={Scene(t0),Scene(t1),…,Scene(tn)}H_{Scene} = \{Scene(t_0),Scene(t_1),…,Scene(t_n)\}
例如:
Scene(t0)
↓
Scene(t1)
↓
Scene(t2)
↓
Scene(t3)
每一个时刻都是现实的结构化快照。
但是相邻场景之间不是孤立的:
Scene(tn+1)=F(Scene(tn),Event,Action,Environment)Scene(t_{n+1}) = F(Scene(t_n),Event,Action,Environment)
因此:
Previous Scene
↓
Scene Change
↓
Current Scene
↓
Next Scene
这使系统能够建立:
现实过程,而不仅仅是现实快照。
这对于后面的行为、经验和学习非常重要。
7.7 场景作为认知输入
Scene 在结构化智能体系中具有一个非常关键的位置:
Scene 是 Cognition 的直接结构化输入。
现实本身不能直接进入认知计算。
首先需要经过:
Reality
↓
Data
↓
Object Recognition
↓
Attribute Extraction
↓
Relation Construction
↓
State Calculation
↓
Scene
↓
Cognition
因此:
Cognition=F(Scene,Knowledge,Goal,Capability,Constraint)Cognition=F(Scene,Knowledge,Goal,Capability,Constraint)
也就是说,认知并不是单纯读取原始数据。
认知面对的是:
已经结构化的当前场景。
7.8 Scene 与 Knowledge 的关系
Scene 与 Knowledge 并不是同一个概念。
这是结构化智能体系中必须保持的区别。
Scene
描述:
现实当前是什么样。
Knowledge
描述:
系统已经知道什么,以及这些知识如何映射。
例如:
Scene:
Glass01
Temperature = 80°C
On(Table01)
这是当前现实状态。
而 Knowledge 可能包含:
Glass
Temperature
Fragility
Heating
Cooling
Handling Method
即:
Scene 是当前实例化现实,Knowledge 是可复用的结构化知识。
可以表示为:
Scene⊂CurrentRealityScene \subset CurrentReality
而:
Knowledge⊂StructuredGeneralizedInformationKnowledge \subset StructuredGeneralizedInformation
二者发生交互:
Scene
↓
Knowledge Matching
↓
Cognition
7.9 Scene 与 Capability 的关系
场景不仅告诉系统“发生了什么”,还可以用于判断:
当前有哪些能力可以使用。
例如:
Scene:
Robot01
Box01
Distance = 30cm
BoxWeight = 1kg
Gripper = Available
系统从场景中获得:
Object = Box01
Position = ...
Weight = 1kg
Distance = 30cm
然后与能力条件匹配:
Capability:
Grasp(Box, Position, Force, Velocity)
形成:
Scene→Capability MatchingScene \rightarrow Capability\ Matching
进一步:
Scene+Capability→CognitionScene+Capability \rightarrow Cognition
这为后面的:
Knowledge
↓
Capability
↓
Cognition
建立了现实输入基础。
7.10 Scene 的动态结构
场景不是固定的数据结构。
可以定义:
Scene(t)={O(t),A(t),R(t),S(t),C(t)}Scene(t)= \{O(t),A(t),R(t),S(t),C(t)\}
因此:
Scene(t+Δt)≠Scene(t)Scene(t+\Delta t) \neq Scene(t)
但这种变化通常具有结构连续性。
例如:
Scene(t)
│
├── Object continuity
├── State continuity
├── Relation continuity
└── Environment continuity
↓
Scene(t+1)
这意味着结构化智能可以不必每次重新建立整个世界,而是:
在已有场景结构基础上计算发生变化的部分。
这对于实时认知系统尤其重要。
7.11 Scene 的统一模型
综合前面的理论,可以定义:
Scene={Objects,Attributes,Relations,States,Context,Time}\boxed{ Scene= \{Objects,Attributes,Relations,States,Context,Time\} }
动态场景:
Scene(t)=F(O(t),A(t),R(t),S(t),C(t))\boxed{ Scene(t)=F(O(t),A(t),R(t),S(t),C(t)) }
场景变化:
ΔScene=Scene(t1)−Scene(t0)\boxed{ \Delta Scene= Scene(t_1)-Scene(t_0) }
场景转移:
Scenet→Event/Action/EnvironmentScenet+1\boxed{ Scene_t \xrightarrow{Event/Action/Environment} Scene_{t+1} }
认知输入:
Cognition=F(Scene,Knowledge,Goal,Capability,Constraint)\boxed{ Cognition= F(Scene,Knowledge,Goal,Capability,Constraint) }
7.12 场景在结构化智能中的位置
到本章为止,前七章已经形成第一条完整的现实结构链:
Element
↓
Object
↓
Attribute
↓
Value
↓
Relation
↓
State
↓
Scene
其含义逐渐从微观结构扩大到整体现实:
Element
最小结构信息
↓
Object
独立现实实体
↓
Attribute
对象特征
↓
Value
具体取值
↓
Relation
实体之间联系
↓
State
当前条件
↓
Scene
多对象、多关系、多状态形成的现实整体
因此,Scene 是前面所有基础结构的第一次综合。
可以进一步形成:
Element→Object→Attribute→Value→Relation→State→Scene\boxed{ Element \rightarrow Object \rightarrow Attribute \rightarrow Value \rightarrow Relation \rightarrow State \rightarrow Scene }
而从 Scene 开始,系统才真正获得了一个可以进行认知计算的现实结构输入空间。
7.13 本章核心结论
本章建立五个基本命题:
第一,Scene 是由多个对象、属性、关系、状态以及环境和时间共同形成的结构化现实单元。
第二,多对象场景不是对象列表,而是对象与关系共同形成的结构网络。
第三,Scene State 是多个对象状态、关系状态以及环境条件形成的整体状态。
第四,Scene 会随着对象、属性、关系、状态和环境变化而持续变化。
第五,Scene 是结构化智能进行认知计算的直接现实输入。
最终形成:
Reality
↓
Data
↓
Element
↓
Object
↓
Attribute / Value
↓
Relation
↓
State
↓
Scene
↓
Cognition
由此,第一篇“结构化智能基础”已经完成了从最小结构单元到现实场景结构的建立。
下一章进入第二篇:
第8章 知识的重新定义
其核心问题将从:
“现实是如何结构化的?”
转向:
“结构化现实如何转化为知识?”
也就是从:
Scene→KnowledgeScene \rightarrow Knowledge
开始建立整个 结构化知识理论。