首页 理论 架构 工程 文档 白皮书 著作 研究 案例 下载 博客 关于 开始使用 →

第131章 Scene 场景

第131章 Scene

场景

前面的认知结构已经逐层建立:

Perception
   ↓
Element
   ↓
Object
   ↓
Attribute
   ↓
Relation
   ↓
Dynamic Relation

到这里,机器已经能够理解:

一个元素是什么
一个对象是什么
对象具有什么属性
对象之间有什么关系
关系正在如何变化

但现实世界并不是由孤立的 Object 和 Relation 组成的。

机器真正面对的是:

一个房间
一张桌子
一个鸡蛋
一只手
一个机器人
周围的墙壁
当前的位置
当前的状态
正在发生的变化

这些信息共同形成:

Scene

因此,本章第一次建立完整的:

Scene Cognition

131.1 什么是 Scene

可以定义:

Scene 是认知系统在特定时间与空间范围内,对多个 Elements、Objects、Attributes、Relations、States 以及 Environment 进行统一组织后形成的整体认知结构。

最基本结构:

Scene
├── Elements
├── Objects
├── Attributes
├── Relations
├── States
└── Environment

因此:

Scene
=
Objects
+
Relations
+
States
+
Environment

但完整的 Scene 还必须保留:

Elements
+
Attributes

因为 Scene 不是直接从 Object 开始产生的。

完整认知链:

Perception
    ↓
Elements
    ↓
Objects
    ↓
Attributes
    ↓
Relations
    ↓
States
    ↓
Scene

131.2 Scene 不是图片

这是本章最重要的定义。

传统计算机视觉很容易把 Scene 理解为:

Image

例如:

Camera
 ↓
Image

图像里可能看到:

Table
Egg
Hand
Robot

但是:

Image ≠ Scene

因为一张图片只是:

Visual Projection

而 Scene 是:

Cognitive Structure

例如图片中看到:

Hand
Egg
Table

真正的 Scene 可能是:

Hand
   ↓ approaching
Egg
   ↓ supported_by
Table

以及:

Robot
   ↓ near
Table

所以:

Image 描述“看到了什么”,Scene 描述“当前世界是什么结构”。


131.3 Scene 是多元认知结构

第125章已经建立:

Multivariate Perception

一个现实对象不是单个数据值。

例如:

Egg
├── Position
├── Orientation
├── Distance
├── Velocity
├── Contact
├── Force
├── Fragility
└── Obstacle Context

这些信息进入:

Object

之后,与其他对象组合:

Egg
Hand
Table
Robot

再通过:

Relations

连接起来。

最终形成:

Scene

因此:

Multivariate Perception
        ↓
Multivariate Objects
        ↓
Relational Structure
        ↓
Scene

131.4 Scene 的空间范围

Scene 必须具有:

Spatial Boundary

例如:

Room Scene

可能包括:

Wall
Floor
Table
Chair
Egg
Robot

但同一个现实世界,也可以形成:

Table Scene

只关注:

Table
Egg
Cup
Hand

甚至:

Egg Interaction Scene

只关注:

Egg
Hand
Table

因此:

Scene 不是世界本身,而是认知系统在某一空间范围内选取和组织的一部分世界。


131.5 Scene 的时间范围

Scene 同样具有:

Temporal Boundary

例如:

Scene(t1)

可能是:

Egg on Table
Hand Far

而:

Scene(t2)

变成:

Egg on Table
Hand Near

再到:

Scene(t3)

变成:

Hand Contact Egg

因此:

Scene(t)

才是真正的动态场景模型。

可以表示为:

Scene
=
Spatial Context
+
Temporal State

131.6 Scene 的基本结构

可以建立:

Scene
{
    id,

    timestamp,

    elements,

    objects,

    attributes,

    relations,

    states,

    environment
}

进一步:

Scene
{
    id,

    spatial_scope,

    temporal_scope,

    elements,

    objects,

    attributes,

    relations,

    states,

    environment,

    events,

    confidence
}

其中:

elements

来自:

Perception
objects

来自:

Element → Object
relations

来自:

Object → Object

而:

states

来自:

Object + Relation + Time

131.7 Scene Elements

Scene 的最底层仍然保留:

Elements

例如:

Edge
Color
Sound
Pressure
Temperature
Motion Signal
Contact Signal

这些并不一定都已经形成 Object。

例如:

声音

可能只是:

Sound Element

系统暂时无法确定:

Who produced it?

所以:

Scene
├── Known Objects
└── Raw / Unresolved Elements

非常重要。

这意味着 Scene 不要求所有感知数据都已经被完全理解。


131.8 Scene Objects

Scene 中的 Object 是:

Recognized Cognitive Object

例如:

Scene
├── Egg
├── Table
├── Hand
├── Robot
└── Cup

每一个 Object 都拥有:

Attributes
Relations
State

例如:

Egg
├── Shape = Oval
├── Fragility = High
├── Position = P1
├── State = Supported
└── Relations

因此 Scene 是多个 Object 的统一容器。


131.9 Scene Attributes

Scene 不只有 Object Attribute。

还存在:

Scene-level Attributes

例如:

Lighting
Temperature
NoiseLevel
Visibility
Crowding
TimeOfDay

这些属性并不属于单独的 Object。

例如:

Lighting = Low

不是:

Egg.Lighting

而是:

Scene.Lighting

因此:

Object Attribute

和:

Scene Attribute

必须区分。


131.10 Scene Relations

Scene 中所有 Object Relation 可以组成:

Relation Network

例如:

Hand
 ↓ approaching
Egg
 ↓ supported_by
Table

Robot
 ↓ near
Table

于是:

Scene.Relations

可以表示:

R1 = Approaching(Hand,Egg)
R2 = SupportedBy(Egg,Table)
R3 = Near(Robot,Table)

这使 Scene 成为:

Object Graph

而不是:

Object List

131.11 Scene States

Scene 还必须记录:

Current States

例如:

Egg = Supported
Hand = Approaching
Robot = Moving
Door = Open
Table = Stable

这些 State 可以来自:

Object State
+
Relation State
+
Environment State

因此:

Scene States
├── Object States
├── Relation States
└── Environment States

131.12 Environment

Environment 是 Scene 的重要组成部分。

例如:

Environment
├── Room
├── Floor
├── Wall
├── Lighting
├── Temperature
├── Obstacles
└── Background Conditions

它与 Object 的区别在于:

Object

通常是 Scene 中具有独立认知身份的实体。

而:

Environment

描述对象所处的:

Context

例如:

Egg

是 Object。

而:

Room

可以作为 Environment。

但环境本身也可能被系统进一步建模为 Object。

因此:

Environment 是一种认知角色,而不一定是绝对固定的数据类型。


131.13 Scene Context

同一个 Object 在不同 Scene 中意义可能完全不同。

例如:

Egg

在:

Kitchen Scene

可能表示:

Food Object

在:

Laboratory Scene

可能表示:

Experimental Object

因此:

Object

需要:

Scene Context

才能获得完整的认知意义。

结构:

Object
   +
Scene Context
   ↓
Contextual Meaning

131.14 Scene 与 Context

可以进一步建立:

Scene
   ↓
Context

例如:

Kitchen

提供:

Food
Cooking
Table
Utensils

相关背景。

而:

Workshop

提供:

Tools
Machines
Materials
Work Surfaces

相关背景。

因此:

Scene 为 Object 提供认知上下文。


131.15 Scene 是 Object 的集合,但不只是集合

如果:

Scene = Objects

那么:

Scene
=
Egg
+
Hand
+
Table

这远远不够。

因为系统还不知道:

Hand 与 Egg 什么关系?
Egg 与 Table 什么关系?
当前发生了什么?
环境是什么?
对象正在怎么变化?

因此正确模型:

Scene
=
Objects
+
Attributes
+
Relations
+
States
+
Environment

进一步:

Scene
=
Elements
+
Objects
+
Attributes
+
Relations
+
States
+
Environment

131.16 Scene 是结构

因此 Scene 的本质不是:

Collection

而是:

Structure

例如:

Scene
│
├── Object: Table
│
├── Object: Egg
│
├── Object: Hand
│
├── Relation:
│     Egg → SupportedBy → Table
│
├── Relation:
│     Hand → Approaching → Egg
│
├── State:
│     Egg = Stable
│
└── Environment:
      Kitchen

这里每一部分都相互连接。


131.17 Scene Graph

因此可以形成:

Scene Graph

例如:

             Kitchen
                │
        ┌───────┴───────┐
        ↓               ↓
      Table           Robot
        │                │
       near             near
        │                │
       Egg ─────────── Hand
        ↑              │
        │           approaching
     supported_by       │
        │              ↓
        └──────────── Egg

更加严格地:

Nodes
=
Objects

Edges
=
Relations

而 Scene Graph 是:

Object Graph
+
Environment Context

131.18 Dynamic Scene

因为 Relation 是动态的:

Scene

自然也是动态的。

定义:

Scene(t)

例如:

t1

Hand ──Far──> Egg
Egg ──SupportedBy──> Table

t2

Hand ──Approaching──> Egg
Egg ──SupportedBy──> Table

t3

Hand ──Contact──> Egg
Egg ──SupportedBy──> Table

t4

Hand ──Holding──> Egg
Egg ──Leaving──> Table

于是:

Scene(t1)
   ↓
Scene(t2)
   ↓
Scene(t3)
   ↓
Scene(t4)

形成:

Dynamic Scene

131.19 Scene Change

两个时间点之间:

Scene(t1)

和:

Scene(t2)

可以比较:

ΔScene

例如:

Object Added
Object Removed
Attribute Changed
Relation Created
Relation Ended
State Changed
Environment Changed

因此:

ΔScene

就是:

Scene Change

131.20 Scene Change Detection

可以建立:

Scene(t-1)
+
Scene(t)
       ↓
Scene Comparison
       ↓
Scene Change

例如:

t1:
Egg on Table

t2:
Egg in Hand

系统发现:

Relation:
SupportedBy(Egg,Table)

消失。

同时:

Relation:
Holding(Hand,Egg)

建立。

于是:

Scene Change

可以表达:

Egg transferred
from
Table
to
Hand

这比单纯的 Object Detection 高很多层。


131.21 Scene Event

Scene Change 可以进一步产生:

Event

例如:

Relation Change
       ↓
Scene Change
       ↓
Event

例如:

Approaching
↓
Contact

形成:

Contact Event

又例如:

SupportedBy(Egg,Table)
↓
Ended

Holding(Hand,Egg)
↓
Created

形成:

Pickup Event

因此:

Scene

成为 Event Detection 的重要基础。


131.22 Scene 与 Behavior

行为并不一定存在于单个 Object 中。

例如:

Pickup

需要:

Hand
+
Egg
+
Table

以及:

Approaching
+
Contact
+
Holding
+
SupportedBy Change

所以:

Behavior

实际上是:

Scene Change Pattern

可以表示:

Scene(t1)
      ↓
Scene(t2)
      ↓
Scene(t3)
      ↓
Scene(t4)

通过连续 Scene 状态变化识别:

Pickup
Place
Push
Pull
Open
Close
Move

131.23 Scene 与 Situation

需要进一步区分:

Scene

和:

Situation

Scene 更偏向:

当前世界结构

Situation 更偏向:

当前具有认知意义的状态组合

例如:

Scene:
Room
Table
Egg
Hand
Robot

而:

Situation:
Hand is about to pick up Egg

所以:

Scene
   ↓
Situation Recognition

Scene 提供:

World Structure

Situation 提供:

Meaningful Current Configuration

131.24 Scene 与 Environment 的关系

可以定义:

Scene
├── Local Objects
├── Relations
├── States
└── Environment Context

例如:

Kitchen Scene

包含:

Environment:
Kitchen

Objects:
Table
Egg
Hand
Cup

Relations:
Egg On Table
Hand Near Egg

States:
Egg Stable
Hand Moving

因此 Environment 是 Scene 的背景条件。


131.25 Scene Identity

Scene 本身也需要一个:

Scene ID

例如:

S001

因为机器需要知道:

当前是哪一个 Scene?

例如:

S001 = Kitchen Table Interaction
S002 = Doorway Navigation
S003 = Robot Charging

因此:

Scene
{
    id
}

是必要的。


131.26 Scene Boundary

Scene 还需要:

Boundary

例如:

Spatial Boundary

定义:

X
Y
Z

范围。

也可以是:

Semantic Boundary

例如:

Kitchen Area

或:

Robot Workspace

因此 Scene 不一定只由几何范围定义。

可以存在:

Geometric Scene

和:

Semantic Scene

131.27 Scene Observation

Scene 不一定是绝对真实世界。

机器看到的是:

Observed Scene

因此应该区分:

World

与:

Observed Scene

例如:

真实世界:
Egg 在 Table 后面

Camera:
看不到 Egg

那么机器的 Scene 可能:

Table
Hand
Robot

但:

Egg = Unknown / Occluded

因此:

Scene 是当前认知系统对世界的可观测模型,而不是世界本身。

这是非常重要的认知边界。


131.28 Scene Confidence

Scene 中不同部分可以拥有不同可信度:

Egg
Confidence = 0.98

但:

Contact(Hand,Egg)
Confidence = 0.62

或者:

Object Identity
Confidence = 0.75

因此:

Scene Confidence

不是一个简单的单值。

更合理的是:

Element Confidence
Object Confidence
Relation Confidence
State Confidence

分别存在。


131.29 Scene Memory

Scene 也可以进入记忆。

例如:

Scene Memory

记录:

S001
Kitchen
10:30
Egg on Table
Hand approaching

之后:

S002
Kitchen
10:31
Egg held by Hand

于是系统可以比较:

S001
vs
S002

得到:

Scene Transition

这使 Scene 成为:

Cognitive Memory

的重要单位。


131.30 Scene Prediction

如果机器拥有:

Current Scene
+
Dynamic Relations
+
History

就可以预测:

Future Scene

例如:

Current:
Hand Approaching Egg

预测:

Future:
Hand Contact Egg

再预测:

Future:
Egg Held

所以:

Scene(t)
+
Relation Dynamics
       ↓
Scene(t+1)

形成:

Scene Prediction

131.31 Scene 与 Decision

决策不应该只根据一个 Object。

例如:

Egg
Fragility = High

本身不能决定:

Robot 应该怎么做。

还需要:

Hand Position
Table Position
Obstacle
Robot State
Egg State
Environment

共同形成:

Current Scene

然后:

Scene
 ↓
Situation
 ↓
Risk
 ↓
Decision

因此:

Decision 的真实输入不是单个 Object,而是当前 Scene。


131.32 Scene 的层级

可以进一步建立 Scene 层级:

World
 ↓
Environment
 ↓
Scene
 ↓
SubScene
 ↓
Object

例如:

House
 ↓
Kitchen
 ↓
Table Area
 ↓
Egg Interaction Area
 ↓
Egg

因此一个 Scene 可以包含:

SubScenes

例如:

Kitchen Scene
├── Cooking SubScene
├── Dining SubScene
└── Cleaning SubScene

131.33 Scene 与多个视角

同一个 Scene 可以由多个 Perception Source 共同构建:

Camera A
Camera B
Depth Sensor
Microphone
Force Sensor

共同输入:

Scene Builder

形成:

Unified Scene

因此:

Perception
   ├── Vision
   ├── Audio
   ├── Touch
   ├── Force
   └── Temperature
          ↓
      Scene Fusion
          ↓
         Scene

这与第125章的:

Multivariate Perception

进一步统一。


131.34 Scene Fusion

多源感知可能产生:

Vision:
Hand Near Egg

Depth:
Distance = 4cm

Force:
Contact = TRUE

系统融合:

Vision
+
Depth
+
Force

得到:

Scene Relation:
Hand Contact Egg

因此:

Scene

是一个:

Multi-Source Cognitive Structure

而不是某一个传感器的直接输出。


131.35 Scene Builder

工程上可以建立:

Scene Builder

数据流:

Perception
      ↓
Element Extraction
      ↓
Object Construction
      ↓
Attribute Update
      ↓
Relation Construction
      ↓
State Evaluation
      ↓
Environment Modeling
      ↓
Scene Builder
      ↓
Current Scene

输出:

Scene(t)

131.36 Scene Update

每一个新的感知周期:

Perception(t)

都可以更新:

Scene(t-1)

得到:

Scene(t)

即:

Scene(t)
=
Update(
    Scene(t-1),
    Perception(t)
)

这意味着 Scene 是:

Persistent Cognitive State

而不是一次性生成的对象。


131.37 Scene State Machine

Scene 自身也可以拥有状态:

Unknown
   ↓
Observed
   ↓
Constructed
   ↓
Stable
   ↓
Changing
   ↓
Updated

例如:

Scene

最初:

Unknown

传感器获得数据:

Observed

对象与关系建立:

Constructed

环境稳定:

Stable

手进入场景:

Changing

系统重新计算:

Updated

因此 Scene 也属于:

Stateful Cognitive Structure

131.38 Scene 的核心数学表示

可以定义:

Scene(t)
=
{
    E(t),
    O(t),
    A(t),
    R(t),
    S(t),
    Env(t)
}

其中:

E(t)   = Elements
O(t)   = Objects
A(t)   = Attributes
R(t)   = Relations
S(t)   = States
Env(t) = Environment

因此:

Scene(t)

是某一时间点的完整认知快照。

但是它不是静态图片。

它是:

Cognitive State Snapshot

131.39 Scene Evolution

连续时间:

Scene(t1)
   ↓
Scene(t2)
   ↓
Scene(t3)
   ↓
Scene(t4)

形成:

Scene Evolution

因此可以建立:

Scene History

即:

S(t1)
S(t2)
S(t3)
S(t4)
...

进一步:

Scene History
      ↓
Scene Transition
      ↓
Behavior / Event

131.40 Scene Transition

两个 Scene 之间存在:

SceneTransition

例如:

Scene A:
Egg on Table

        ↓

Scene B:
Egg Held by Hand

Transition 可以记录:

Objects Changed
Relations Changed
States Changed
Environment Changed

例如:

Relation Removed:
SupportedBy(Egg,Table)

Relation Added:
Holding(Hand,Egg)

于是:

Scene A
   ↓
Transition
   ↓
Scene B

这为行为理解提供结构化基础。


131.41 Scene 与 Cognition

至此:

Element

回答:

感知到了什么基础信号?

Object

回答:

这个东西是什么认知实体?

Attribute

回答:

它有什么性质?

Relation

回答:

它与其他对象是什么关系?

Dynamic Relation

回答:

关系正在如何变化?

而:

Scene

回答:

这些对象、属性、关系、状态和环境当前共同构成了什么世界结构?

因此 Scene 是一个重要的认知跃迁。


131.42 从 Object Cognition 到 Scene Cognition

之前:

Object Cognition

主要关注:

Egg

现在:

Scene Cognition

关注:

Egg
+
Hand
+
Table
+
Robot
+
Environment
+
Relations
+
States

于是:

Object
   ↓
Object Network
   ↓
Scene

形成:

Local World Model

131.43 Scene 的完整认知模型

最终可以建立:

Scene
│
├── Elements
│   ├── Visual
│   ├── Audio
│   ├── Touch
│   ├── Force
│   └── Other Signals
│
├── Objects
│   ├── Object A
│   ├── Object B
│   └── Object C
│
├── Attributes
│   ├── Stable
│   └── Dynamic
│
├── Relations
│   ├── Spatial
│   ├── Physical
│   ├── Motion
│   └── Functional
│
├── States
│   ├── Object States
│   ├── Relation States
│   └── Environment States
│
└── Environment
    ├── Space
    ├── Lighting
    ├── Temperature
    ├── Obstacles
    └── Context

这第一次形成完整的:

Cognitive Scene Model

131.44 Scene 的动态模型

进一步:

                    Scene(t)
                       │
        ┌──────────────┼──────────────┐
        ↓              ↓              ↓
     Objects        Relations       Environment
        │              │              │
     Attributes      Dynamics       Conditions
        │              │              │
        └──────────────┼──────────────┘
                       ↓
                  Scene State
                       ↓
                  Scene Change
                       ↓
                 Scene Transition
                       ↓
                  Event / Behavior

所以 Scene 不再是:

Image

而是:

Dynamic Cognitive World State

131.45 Scene 的核心定义

Scene 是机器在特定空间与时间范围内,将 Elements、Objects、Attributes、Relations、States 与 Environment 组织成统一结构后形成的动态认知世界模型。

核心结构:

Scene
├── Elements
├── Objects
├── Attributes
├── Relations
├── States
└── Environment

核心动态:

Scene(t)
   ↓
Scene(t+1)
   ↓
Scene Change

核心关系:

Objects
   ↓
Relations
   ↓
Dynamic Relations
   ↓
Scene

核心认知链:

Perception
   ↓
Element
   ↓
Object
   ↓
Attribute
   ↓
Relation
   ↓
Dynamic Relation
   ↓
Scene

最终形成:

              COGNITIVE SCENE
                     │
      ┌──────────────┼──────────────┐
      ↓              ↓              ↓
   Elements       Objects       Environment
                     │
              ┌──────┴──────┐
              ↓             ↓
         Attributes      States
              │             │
              └──────┬──────┘
                     ↓
                 Relations
                     ↓
              Dynamic Relations
                     ↓
               Scene Change
                     ↓
                  Situation
                     ↓
                   Event
                     ↓
                 Behavior

因此,本章完成了一个非常关键的认知跃迁:

Element

是:

感知世界的基础单位。

Object

是:

被组织起来的认知实体。

Relation

是:

对象之间的结构连接。

Dynamic Relation

是:

对象关系的时间变化。

而:

Scene

则是:

多个动态对象及其关系、状态和环境在特定时空中的统一认知结构。

所以:

Scene ≠ Image
Scene ≠ Object List
Scene ≠ Relation List

而是:

Scene
=
Elements
+
Objects
+
Attributes
+
Relations
+
States
+
Environment
+
Time

由此,WSaiOS-ICAI 第一次拥有了真正意义上的:

World Representation

机器开始从:

“我看到了什么?”

进入:

“当前世界是什么状态?”

而下一步自然出现更深的问题:

如果 Scene 是一个动态世界结构,那么机器如何从当前 Scene 中识别“正在发生的事情”?

这将把:

Scene
   ↓
Scene Change

进一步推进到:

Scene
   ↓
Situation
   ↓
Event

即下一阶段的 Situation Cognition / Event Cognition

Leave a Reply

Your email address will not be published. Required fields are marked *