首页 / 《WSaiOS 人工认知智能感知篇》 / 正文

第十五章 WSaiOS 非 Token 多模态语义表示模型

作者:wsp188 | 发布时间:2026-07-21 11:30 | 分类:《WSaiOS 人工认知智能感知篇》

第十五章

WSaiOS 非 Token 多模态语义表示模型

WSaiOS Non-Token Multimodal Semantic Representation Model

——从 Token 表示到世界语义结构表示


15.1 多模态表示问题

当前主流 AI 多模态系统:

通常采用:

视觉输入

↓

视觉编码器

↓

视觉 Token

↓

语言模型

↓

输出

例如:

一张图片:

像素矩阵

↓

视觉特征

↓

离散 Token 序列

↓

Transformer处理

这种方式解决:

如何让语言模型理解视觉。


但是 WSaiOS 关注的问题不同:

如何让人工智能系统建立对世界的结构化理解。


因此 WSaiOS 不以 Token 作为核心表示单位。

而采用:

Semantic World Representation

世界语义表示模型。


15.2 WSaiOS 非 Token 思想

传统:

Data

↓

Token

↓

Model

WSaiOS:

Data

↓

Element

↓

State

↓

Relation

↓

Event

↓

World Model

区别:

Token 是:

信息编码单位。


Element 是:

世界认知单位。


例如:

图片:

传统:

Pixel

↓

Token

WSaiOS:

Pixel

↓

Table

↓

Position

↓

State

↓

Relation

↓

Scene

15.3 为什么 WSaiOS 不依赖 Token

原因:

1. 认知对象不是数据片段

人理解世界:

不是:

看到一万个像素。

而是:

看到:

一张桌子

一个人

一辆车

一个房间

2. 世界具有结构

现实世界:

天然存在:

  • 对象;
  • 属性;
  • 关系;
  • 状态;
  • 时间。

例如:

不是:

RGB数据变化

而是:

汽车移动

3. 减少重复信息

视频:

大量重复。

Token:

仍然需要编码。


WSaiOS:

保存:

静态世界

+
动态变化

15.4 WSaiOS 世界语义单元

WSaiOS 的基础单位:

不是 Token。

而是:

World Semantic Element(世界语义元素)


结构:

{
"id":"element001",

"type":"vehicle",

"position":{

"x":100,

"y":200

},

"state":{

"moving":true

},

"relation":[]

}

一个元素包含:

Identity

身份。


Attribute

属性。


Position

空间。


State

状态。


Relation

关系。


History

历史。


15.5 图像元素组合表示

WSaiOS 视觉理解:

不是:

图片→Token。


而是:

图片:

Scene Image

分解:

Scene

├── Building

│

├── Road

│

├── Vehicle

│

└── Person

形成:

Semantic Scene Graph

语义场景图。


例如:

{
"scene":"street",

"elements":[

{

"type":"car"

}

],

"relations":[

{

"car":

"on road"

}

]

}

15.6 视频动态语义表示

视频:

不是:

Frame1

Frame2

Frame3

WSaiOS:

表示:

World State 1


↓

Change Event


↓

World State 2

例如:

开始:

{
"door":

"closed"

}

变化:

{
"event":

"door_open"

}

结果:

{
"door":

"open"

}

15.7 多模态统一表示

WSaiOS 不分别保存:

视觉:

image data

声音:

audio data

文本:

language data

而转换:

统一世界对象。


例如:

视觉:

看到:

person

声音:

听到:

speech

文本:

输入:

张三来了

融合:

{

"entity":

"person001",

"identity":

"ZhangSan",

"location":

"office"

}

15.8 多模态融合结构

          Vision


             ↓


          Element


             ↑


Audio ← World Model → Language


             ↓


        Sensor Data

所有输入:

最终进入:

World Model。


15.9 WSaiOS 语言语法表示

前面提出:

WSaiOS 没有 Token。

而通过:

语言语法组织。


例如:

自然语言:

房间里面有一个人在移动。


转换:

{
"subject":

"person001",

"location":

"room001",

"action":

"move"

}

语言不是:

Token 序列。


而是:

Semantic Grammar Structure

语义语法结构。


15.10 语言到世界模型转换

流程:

Sentence


↓

Semantic Parser


↓

Intent / Entity / Relation


↓

World Update


↓

Cognition

例如:

输入:

“打开办公室灯”。


解析:

{

"action":

"open",

"target":

"office_light"

}

进入:

Action Engine。


15.11 Token 与 WSaiOS 对比

项目 Token模型 WSaiOS
基本单位 Token World Element
目标 预测信息 理解世界
视觉表示 视觉Token 视觉元素
视频处理 连续编码 状态变化
语言处理 词元序列 语义结构
记忆 上下文窗口 世界记忆
推理 概率预测 状态推理

15.12 工程实现结构

WSaiOS:

semantic_engine/


├── element/

│   └── world_element.py


├── grammar/

│   └── semantic_parser.py


├── relation/

│   └── relation_graph.py


├── state/

│   └── state_manager.py


├── event/

│   └── event_mapper.py


└── world_model.py

15.13 核心数据流程

Image

↓

Visual Element


Audio

↓

Audio Element


Text

↓

Semantic Element


↓

Element Fusion


↓

World Model


↓

Cognition

15.14 WSaiOS 与 AI Token 视频技术关系

新闻中的:

AI Token 视频传输。

解决:

如何降低视频数据传输量。


WSaiOS:

解决:

如何让 AI 理解视频世界。


两者可以结合:

未来:

视频输入

↓

Token编码层

↓

WSaiOS世界模型层

↓

认知系统

或者:

视频

↓

WSaiOS元素解析

↓

低数据量世界状态传输

↓

AI认知

15.15 本章总结

WSaiOS 非 Token 多模态语义表示模型实现:

✅ 世界元素表示
✅ 图像元素组合
✅ 视频状态变化表示
✅ 多模态统一世界模型
✅ 语言语义结构解析
✅ 非 Token 信息组织方式

核心理念:

传统 AI:

数据
↓
Token
↓
模型

WSaiOS:

数据
↓
语义元素
↓
世界状态
↓
关系
↓
事件
↓
认知

《WSaiOS 人工认知智能感知篇》核心理论闭环形成

目前:

感知输入

↓

元素理解

↓

世界建模

↓

状态变化

↓

事件理解

↓

环境理解

↓

记忆

↓

语义表示

↓

人工认知

下一章:

第十六章

WSaiOS 多模态世界模型工程实现

WSaiOS Multimodal World Model Engineering

重点:

  • 世界模型数据库设计;
  • 元素存储;
  • 关系图谱;
  • 状态同步;
  • 多模态数据融合;
  • 世界模型 API。

联系我们

欢迎咨询AI系统开发、网站建设、搜索优化、项目定制合作

联系方式

  • 电话:15089196448
  • 邮箱:1602401899@qq.com
  • 地址:陕西省渭南市
  • 服务时间:周一至周五 09:00 - 18:00 | 7×24小时技术值守