第34章 反馈理论
一、提出背景
第33章建立了行为执行理论,形成了:
行为→动作→执行→执行状态→执行结果→状态变化
但是,一个行为产生结果以后,认知系统不能简单地认为行为已经结束。执行结果本身还包含大量关于当前状态、对象变化、场景变化以及行为有效性的信息。
例如,一个动作执行完成以后,系统需要知道:
动作是否真正完成?
对象是否发生预期变化?
当前状态是否已经改变?
场景是否发生变化?
原行为是否仍然有效?
因此,执行结果必须重新进入认知过程。
这一过程就是反馈。
**反馈(Feedback)**是行为执行产生的信息返回到认知、状态和行为控制结构中,并影响后续判断、调整和执行的过程。
基本关系为:
执行→结果→反馈→重新判断→下一行为
反馈使行为系统从单向执行结构:
行为→动作→结果
发展为动态闭环:
行为→动作→执行→结果→反馈→状态更新→行为调整→下一行为
因此,反馈理论是连接行为执行与持续行为控制的重要理论层。
二、执行反馈
2.1 执行反馈的定义
**执行反馈(Execution Feedback)**是动作执行以后,对执行过程、执行状态和执行结果进行记录、判断并返回行为系统的信息。
定义执行反馈:
F_e=(A,E,S,R,C)
其中:
A:执行动作;E:执行过程;S:执行状态;R:执行结果;C:反馈结论。
执行反馈回答的是:
“刚才的动作执行得怎么样?”
基本过程:
Action→Execution→Result→ExecutionFeedback
2.2 执行成功反馈
如果:
ResultMatch(R,Expected)=1
则:
ExecutionSuccess=1
反馈:
Success→Continue
表示当前动作已经完成,可以进入下一动作或下一行为。
因此:
动作执行→结果确认→成功反馈→下一动作
2.3 执行失败反馈
如果:
ResultMatch(R,Expected)=0
则:
ExecutionSuccess=0
产生:
FailureFeedback
进一步触发:
重新执行
或:
动作替换
或:
行为调整
或:
行为终止
因此:
执行失败→反馈→重新判断→行为调整
2.4 执行过程反馈
反馈并不一定只在执行结束时产生。
执行过程中也可以产生阶段性反馈:
Executing→Feedback→Continue
例如:
动作已经开始
动作正在进行
动作部分完成
动作发生异常
因此:
Execution→ContinuousFeedback
能够使系统及时了解当前执行状态。
三、状态反馈
3.1 状态反馈的定义
**状态反馈(State Feedback)**是行为执行以后,将系统、对象或环境状态的变化返回到认知结构中的过程。
定义:
F_s=(S_before,A,S_after,ΔS)
其中:
S_before:执行前状态;A:执行动作;S_after:执行后状态;ΔS:状态变化。
基本关系:
S_before→Action→S_after
并形成:
S_before→ΔS→StateFeedback
3.2 状态变化反馈
如果:
S_after≠S_before
则说明执行产生了状态变化:
ΔS≠0
反馈系统记录:
StateChange
例如:
杯子在桌面
执行:
拿起杯子
结果:
杯子离开桌面
于是:
S_before→Action→S_after
反馈:
StateChanged
3.3 状态未变化反馈
如果:
S_after=S_before
则:
ΔS=0
这也是一种有效反馈。
例如执行“打开设备”,但设备状态仍然为关闭:
Action→NoStateChange
此时反馈不能简单认为执行成功,而必须重新判断:
执行反馈→状态反馈→结果重新判断
因此:
无状态变化≠没有反馈
而是:
无状态变化→异常或无效状态反馈
3.4 状态反馈与下一行为
新的状态成为下一行为判断的输入:
S_t→Behavior_t→S_{t+1}
因此:
StateFeedback→BehaviorReevaluation
形成:
执行→状态变化→反馈→下一行为判断
四、对象反馈
4.1 对象反馈的定义
**对象反馈(Object Feedback)**是行为执行以后,对行为对象的属性、状态、位置、关系和实例变化进行记录并返回认知系统的过程。
对象可以表示为:
O=(Id,Class,Instance,Attributes,State,Relations)
行为执行以后,对象可能发生变化:
O_t→Action→O_{t+1}
因此对象反馈可以表示为:
F_o=(O_t,A,O_{t+1},ΔO)
其中:
ΔO=O_{t+1}-O_t
表示对象结构发生的变化。
4.2 对象属性反馈
动作可能改变对象属性:
Attribute_t→Attribute_{t+1}
例如:
设备状态=关闭
经过动作以后:
设备状态=开启
对象反馈记录:
AttributeChange
因此:
动作→属性变化→对象反馈
4.3 对象状态反馈
对象状态是对象反馈的重要组成部分。
例如:
O.State_t=Closed
执行:
Open
以后:
O.State_{t+1}=Open
形成:
ObjectState_t→Action→ObjectState_{t+1}
反馈:
ObjectStateChange
4.4 对象关系反馈
对象之间的关系也可能发生变化:
R(O1,O2)_t→R(O1,O2)_{t+1}
例如:
杯子→位于→桌面
经过拿取以后:
杯子→位于→手
因此:
对象关系变化→关系反馈
对象反馈由此不仅记录对象本身,还记录对象在认知网络中的关系变化。
4.5 对象反馈与行为调整
如果对象实际状态与行为预期不一致:
Match(O_actual,O_expected)=0
则:
ObjectFeedback→BehaviorAdjustment
因此:
对象变化→对象反馈→重新匹配→行为调整
五、场景反馈
5.1 场景反馈的定义
**场景反馈(Scene Feedback)**是行为执行以后,对整个场景中的对象、属性、状态、关系和行为变化进行综合返回的过程。
定义场景:
Sc=(O,A,S,R,B)
其中:
O:场景对象;A:对象属性;S:场景状态;R:对象关系;B:场景中的行为。
执行以后:
Sc_t→Behavior→Sc_{t+1}
因此场景反馈:
F_sc=(Sc_t,B,Sc_{t+1},ΔSc)
其中:
ΔSc=Sc_{t+1}-Sc_t
表示场景结构变化。
5.2 场景对象变化
一个行为可能导致场景对象增加或减少:
O_t→O_{t+1}
例如:
对象进入场景
或:
对象离开场景
因此:
ObjectChange→SceneFeedback
5.3 场景状态变化
场景整体状态也可能发生变化:
S_t→S_{t+1}
例如:
设备关闭状态
经过行为:
启动
以后:
设备运行状态
这不仅是对象状态变化,也可能影响整个场景状态。
5.4 场景关系变化
场景中的对象关系可能重新组织:
R_t→R_{t+1}
例如:
对象A与对象B分离
或者:
对象A进入对象B的内部区域
这些变化都可以形成场景反馈。
5.5 场景反馈与行为连续性
场景反馈决定下一阶段行为是否仍然成立:
SceneFeedback→BehaviorReevaluation
如果:
Condition(B_next)⊨Sc_{t+1}
则:
Continue
如果:
Condition(B_next)⊭Sc_{t+1}
则:
BehaviorAdjustment
因此:
场景变化→场景反馈→条件重新判断→下一行为
六、行为反馈
6.1 行为反馈的定义
**行为反馈(Behavior Feedback)**是对一个完整行为执行后的目标完成程度、方法有效性、动作结果、状态变化以及行为适用性的综合反馈。
定义:
F_b=(B,G,M,A,R,S,Sc,C)
其中:
B:执行行为;G:行为目标;M:行为方法;A:行为动作;R:行为结果;S:状态变化;Sc:场景变化;C:反馈结论。
行为反馈回答的是:
“这个行为是否达到了它的目标,以及它是否仍然适合继续使用?”
6.2 目标反馈
行为最基本的判断是目标是否实现。
定义:
GoalMatch=Match(R,G)
如果:
GoalMatch=1
表示行为目标已经达到。
如果:
GoalMatch=0
表示目标没有达到。
因此:
行为结果→目标匹配→行为反馈
6.3 方法反馈
即使行为没有达到目标,也需要判断问题来自哪里。
可能存在:
MethodApplicable=0
表示方法不适用于当前状态。
或者:
MethodApplicable=1
但:
ExecutionResult≠ExpectedResult
表示方法适用,但执行没有达到预期。
因此行为反馈可以用于判断:
方法是否有效
动作是否有效
条件是否正确
对象是否正确
状态是否符合预期
6.4 行为成功反馈
可以定义:
BehaviorSuccess=GoalMatch∧ResultMatch∧StateMatch
其中:
GoalMatch:目标匹配;ResultMatch:结果匹配;StateMatch:状态达到预期。
当三者同时满足:
BehaviorSuccess=1
则:
Behavior→Completed
否则:
Behavior→Adjustment
七、五类反馈的关系
本章五种反馈并不是相互独立的。
它们具有层级关系:
执行反馈
→ 判断动作是否正确执行;
状态反馈
→ 判断执行以后状态是否发生预期变化;
对象反馈
→ 判断相关对象是否发生预期变化;
场景反馈
→ 判断整体场景是否发生预期变化;
行为反馈
→ 判断整个行为是否达到目标。
可以统一表示为:
ExecutionFeedback
→ StateFeedback
→ ObjectFeedback
→ SceneFeedback
→ BehaviorFeedback
但实际运行过程中也可能是并行产生:
执行→{执行反馈、状态反馈、对象反馈、场景反馈}
然后汇总为:
{反馈集合}→行为反馈
因此:
BehaviorFeedback=F(F_e,F_s,F_o,F_sc)
八、反馈与行为调整
反馈的真正作用不是记录,而是影响后续行为。
当反馈结果为:
Success
则:
Feedback→Continue
当反馈结果为:
Failure
则:
Feedback→Reevaluate
进一步:
Reevaluate→Retry
或:
Reevaluate→Replace
或:
Reevaluate→Recompose
或:
Reevaluate→Terminate
因此:
反馈→判断→调整
这是反馈理论与第32章动态行为调整理论之间的重要连接。
九、反馈闭环
综合本章,可以建立完整反馈闭环:
行为→动作→执行→结果
→ 执行反馈
→ 状态反馈
→ 对象反馈
→ 场景反馈
→ 行为反馈
→ 重新判断
→ 行为调整
→ 下一行为
进一步简化为:
B_t→A_t→E_t→R_t→F_t→S_{t+1}→B_{t+1}
其中:
B_t:当前行为;A_t:当前动作;E_t:当前执行;R_t:当前结果;F_t:反馈;S_{t+1}:新的状态;B_{t+1}:下一行为。
因此:
反馈不是执行的终点,而是下一次行为形成的输入。
十、反馈的动态性
反馈本身也是动态结构。
执行过程中:
F_t→F_{t+1}
不同阶段可能得到不同反馈。
例如:
开始执行→执行反馈
对象发生变化→对象反馈
状态发生变化→状态反馈
场景发生变化→场景反馈
行为完成→行为反馈
因此反馈过程可以表示为:
Execution_t→Feedback_t
→ StateChange_t
→ Feedback_{t+1}
→ BehaviorAdjustment
→ Execution_{t+1}
形成持续反馈。
十一、反馈理论统一模型
定义反馈模型:
F=(F_e,F_s,F_o,F_sc,F_b)
其中:
F_e:执行反馈;F_s:状态反馈;F_o:对象反馈;F_sc:场景反馈;F_b:行为反馈。
统一反馈函数:
F_t=Feedback(E_t,R_t,S_t,O_t,Sc_t,B_t)
反馈结果进一步进入行为控制:
F_t→BehaviorEvaluation
行为评价结果:
BehaviorEvaluation→Continue
或:
BehaviorEvaluation→Adjust
或:
BehaviorEvaluation→Terminate
完整模型:
Behavior→Action→Execution→Result→Feedback→Evaluation→Adjustment→NextBehavior
十二、工程映射
反馈理论可以映射为以下工程对象。
1. ExecutionFeedback
负责记录动作执行情况:
Execution→ExecutionFeedback
2. StateFeedback
负责记录:
StateBefore
StateAfter
StateChange
3. ObjectFeedback
负责记录:
ObjectBefore
ObjectAfter
AttributeChange
ObjectStateChange
RelationChange
4. SceneFeedback
负责记录:
SceneBefore
SceneAfter
ObjectChanges
StateChanges
RelationChanges
5. BehaviorFeedback
负责综合判断:
GoalMatch
ResultMatch
StateMatch
BehaviorSuccess
6. FeedbackManager
负责统一管理:
ExecutionFeedback
→ StateFeedback
→ ObjectFeedback
→ SceneFeedback
→ BehaviorFeedback
7. FeedbackAnalyzer
负责:
Feedback→Evaluation
判断当前反馈对应:
Success
Failure
Partial
Change
Exception
等状态。
8. BehaviorAdjustmentController
负责:
Feedback→Reevaluation→BehaviorAdjustment
形成:
BehaviorController→Execution→Feedback→BehaviorController
从而建立行为执行闭环。
十三、本章总结
反馈理论建立的是行为执行后的信息返回机制。
行为执行产生结果:
行为→动作→执行→结果
结果不能停留在执行层,而必须返回到认知结构:
结果→反馈
反馈又可以从不同层次进行描述:
执行反馈
回答“动作执行得怎么样”。
状态反馈
回答“状态发生了什么变化”。
对象反馈
回答“对象发生了什么变化”。
场景反馈
回答“整个场景发生了什么变化”。
行为反馈
回答“整个行为是否达到目标”。
五类反馈最终汇聚为:
执行→结果→反馈→评价
再进一步:
评价→继续
或:
评价→调整
或:
评价→终止
因此形成完整闭环:
行为→动作→执行→结果→执行反馈→状态反馈→对象反馈→场景反馈→行为反馈→行为调整→下一行为
从更高层次看:
行为执行→反馈→状态更新→认知重新判断→行为调整→再次执行
反馈由此成为行为系统实现连续性、动态性和自我调整的基础结构。
在WSaiOS理论体系中,反馈并不是独立于行为之外的信息,而是行为执行以后重新进入认知过程的结构化信息。它把“已经发生的行为”转换为“下一次行为判断所需要的依据”,从而使行为系统形成持续运行的闭环:
行为→执行→结果→反馈→新状态→新行为
这标志着行为理论从单向的“行为执行模型”进一步进入动态的“行为反馈模型”。