第28章 方法评价
方法不是生成出来就可以直接执行。
在人工个体的认知系统中,同一个目标通常可以存在多个不同的方法。不同方法可能具有不同的执行条件、成功概率、风险、资源消耗和时间成本。
因此,动态方法形成之后,还必须进入一个新的认知过程:
方法评价(Method Evaluation)
方法评价的核心不是判断一个方法“是不是方法”,而是判断:
在当前状态、当前目标、当前条件和当前约束下,这个方法是否值得被选择和执行。
因此,第27章“动态方法”产生的是候选方法空间,第28章“方法评价”则负责对候选方法进行结构化比较。
28.1 方法评价的定义
方法评价,是人工个体针对一个或多个候选方法,根据当前场景、目标、状态、条件、能力、约束、风险、历史经验以及资源成本,对方法的可行性、成功率、风险和成本进行计算,并形成方法评价结果的认知过程。
可以表示为:
Candidate Methods
↓
Feasibility Evaluation
↓
Success Rate Evaluation
↓
Risk Evaluation
↓
Cost Evaluation
↓
Method Comparison
↓
Method Evaluation Result
↓
Method Selection
方法评价并不是单一指标判断,而是多个维度共同计算。
其基本结构为:
Method Evaluation
│
├── Candidate Method
├── Feasibility
├── Success Rate
├── Risk
├── Cost
├── Constraint Compliance
├── Resource Requirement
├── Time Requirement
├── Stability
├── Historical Experience
└── Expected Result
因此:
方法评价是方法选择之前的认知计算过程。
28.2 候选方法
28.2.1 什么是候选方法
候选方法,是当前人工个体根据目标、状态、条件、能力和知识所产生的、理论上可能用于完成目标的一组方法。
不是所有候选方法都能够执行。
例如:
目标:完成某项任务
↓
产生候选方法
├── Method A
├── Method B
├── Method C
├── Method D
└── Method E
这些方法只是进入了当前的方法空间。
下一步必须进行评价:
Candidate Methods
↓
Method Evaluation
↓
Valid Methods
↓
Preferred Method
28.2.2 候选方法的产生来源
候选方法可以来自多个来源:
Knowledge
↓
Historical Experience
↓
Existing Methods
↓
Dynamic Method Adaptation
↓
Method Composition
↓
Method Generation
↓
Candidate Method Set
因此,候选方法并不一定全部是预先定义好的。
它可以包括:
- 已知方法
- 历史成功方法
- 当前场景适配方法
- 多方法组合
- 动态调整方法
- 新生成的方法
这与第27章的动态方法形成直接关系。
28.3 方法可行性
方法评价首先要判断:
这个方法能不能做?
这就是方法可行性。
可行性不是成功率。
一个方法可能理论上可以执行,但成功率很低。
也可能一个方法成功率较高,但当前条件根本不允许执行。
因此:
可行性 ≠ 成功率
28.3.1 可行性的基本结构
方法可行性至少需要检查:
Method
↓
Object Check
↓
State Check
↓
Condition Check
↓
Constraint Check
↓
Capability Check
↓
Resource Check
↓
Execution Check
↓
Feasibility
例如:
- 目标对象是否存在?
- 对象状态是否满足?
- 前置条件是否成立?
- 是否违反约束?
- 个体是否具有对应能力?
- 所需资源是否存在?
- 当前执行环境是否允许?
只有这些条件基本成立,方法才进入可执行方法集合。
28.3.2 方法可行性等级
方法可行性可以划分为:
Fully Feasible
↓
Conditionally Feasible
↓
Weakly Feasible
↓
Infeasible
Fully Feasible
所有关键条件满足,可以直接进入执行准备。
Conditionally Feasible
当前不能立即执行,但满足附加条件之后可以执行。
Weakly Feasible
理论上可执行,但存在较大的资源、状态或者环境限制。
Infeasible
当前条件下无法执行。
28.4 方法成功率
可行性解决:
能不能做?
成功率解决:
做成的可能性有多大?
这是两个不同层次的问题。
例如:
Method A
可行:是
成功率:60%
Method B
可行:是
成功率:90%
两个方法都可以执行,但显然方法B在成功概率上更具有优势。
28.4.1 成功率的来源
成功率并不是凭空产生的。
它可以来源于:
Historical Experience
+
Method History
+
Current State
+
Current Condition
+
Capability Reliability
+
Resource State
+
Risk State
↓
Success Probability
历史经验尤其重要。
如果某方法过去在相似场景下执行成功很多次,那么当前成功率可以得到提高。
如果过去频繁失败,则成功率应该降低。
因此:
SuccessRate(t)
=
F(
HistoricalSuccess,
HistoricalFailure,
CurrentState,
CurrentCondition,
CapabilityState,
ResourceState
)
成功率本质上是一种预测性评价指标。
28.5 风险评价
方法成功率并不能完全代表方法质量。
因为两个方法可能拥有相似的成功率,但失败后的损失完全不同。
例如:
Method A
成功率:90%
失败损失:低
Method B
成功率:92%
失败损失:极高
如果只看成功率,系统可能选择Method B。
但是从风险角度来看,Method A可能更加合理。
因此方法评价必须加入:
Risk Evaluation
28.5.1 方法风险
方法风险,是执行某方法后可能产生不利结果的概率、影响程度以及相关风险因素的综合评价。
可以表示为:
Risk
=
Probability
×
Impact
但在实际认知系统中,风险还可以进一步考虑:
Risk
├── Failure Probability
├── Failure Severity
├── Environmental Risk
├── Object Risk
├── Execution Risk
├── Resource Risk
├── Interaction Risk
└── Recovery Difficulty
28.5.2 风险不仅是失败
风险并不等于“执行失败”。
还包括:
- 对象损坏
- 状态恶化
- 资源浪费
- 时间延迟
- 后续方法受影响
- 环境状态变化
- 恢复困难
- 连锁失败
因此:
风险评价关注的是方法执行可能造成什么后果。
28.6 方法成本
方法评价还必须考虑:
完成这个方法需要付出什么?
这就是成本。
成本并不仅仅是金钱。
对于人工个体而言,成本可以是:
Method Cost
│
├── Time Cost
├── Energy Cost
├── Resource Cost
├── Computational Cost
├── Physical Cost
├── Opportunity Cost
├── Recovery Cost
└── Risk Cost
28.6.1 时间成本
方法需要多长时间。
例如:
Method A → 10 seconds
Method B → 30 seconds
如果目标具有时间限制,Method A可能更加适合。
28.6.2 资源成本
包括:
- 设备资源
- 能源
- 空间
- 计算资源
- 工具
- 对象占用
- 其他能力资源
资源不足时,即使方法本身有效,也可能暂时不可执行。
28.6.3 恢复成本
这是动态人工个体中特别重要的一项。
如果一个方法失败之后很容易恢复:
Failure → Recovery → Continue
那么其实际风险较低。
如果失败之后需要重新建立整个任务状态:
Failure
↓
State Damage
↓
Reconstruction
↓
Restart
那么这个方法的真实成本就会显著提高。
因此:
方法评价不仅要评价执行成本,还要评价失败后的恢复成本。
28.7 方法评价模型
方法评价最终需要形成一个结构化模型。
可以定义:
MethodEvaluation
│
├── MethodIdentity
├── Feasibility
├── SuccessRate
├── Risk
├── Cost
├── ConstraintCompliance
├── ResourceRequirement
├── TimeRequirement
├── Stability
├── HistoricalPerformance
├── ExpectedResult
├── Confidence
└── EvaluationScore
其中最重要的几个核心变量是:
Feasibility
SuccessRate
Risk
Cost
28.8 方法评价的基本计算模型
可以建立一个抽象评价函数:
EvaluationScore
=
F(
Feasibility,
SuccessRate,
Risk,
Cost,
ConstraintCompliance,
ResourceAvailability,
Time,
Stability,
Experience
)
在简化模型中,可以表示为:
Score
=
w1 × Feasibility
+
w2 × SuccessRate
+
w3 × Stability
+
w4 × Experience
-
w5 × Risk
-
w6 × Cost
其中:
w1= 可行性权重w2= 成功率权重w3= 稳定性权重w4= 历史经验权重w5= 风险权重w6= 成本权重
但这里必须注意:
评价模型不是简单的数学加权。
因为有些条件属于硬约束。
例如:
ConstraintCompliance = 0
即使成功率为100%,也不能允许执行。
所以实际模型应该分成两个阶段。
28.9 硬约束过滤与软评价
这是方法评价非常重要的结构。
Candidate Methods
↓
Hard Constraint Filtering
↓
Feasible Methods
↓
Soft Evaluation
↓
Method Ranking
↓
Preferred Method
第一阶段:
过滤不能做的方法。
第二阶段:
比较可以做的方法。
例如:
Candidate Methods
A → 可执行
B → 违反安全约束
C → 可执行
D → 缺少资源
E → 可执行
经过硬约束过滤:
A
C
E
再进行:
Success Rate
Risk
Cost
Stability
Experience
等综合评价。
最终:
A → Score 0.72
C → Score 0.89
E → Score 0.76
Selected Method → C
这比单纯计算一个总分更加符合人工个体认知结构。
28.10 方法评价与方法选择
方法评价和方法选择不能混为一谈。
方法评价回答:
哪个方法更好?
方法选择回答:
最终采用哪个方法?
关系为:
Candidate Methods
↓
Method Evaluation
↓
Evaluation Results
↓
Method Ranking
↓
Method Selection
↓
Selected Method
因此:
Method Evaluation ≠ Method Selection
方法评价提供判断依据。
方法选择负责最终决策。
28.11 方法评价与第27章动态方法
第27章解决:
方法从哪里来?
第28章解决:
这些方法哪个更适合?
两章之间形成:
Current Cognition
↓
Dynamic Method
↓
Candidate Methods
↓
Method Evaluation
↓
Method Selection
因此动态方法并不是评价的终点。
它只是产生当前的方法空间。
而方法评价负责压缩方法空间。
可以理解为:
Method Generation
↓
扩大方法空间
↓
Method Evaluation
↓
缩小方法空间
↓
Method Selection
↓
确定当前方法
28.12 方法评价与实时认知
第25章提出实时认知。
实时认知意味着:
方法评价也不能永久有效。
因为现实环境会变化。
例如:
t1
Method A
成功率 90%
风险低
环境发生变化:
t2
Object State Changed
Environment Changed
Resource Changed
重新计算:
Method A
成功率 50%
风险升高
此时原来的评价结果已经失效。
所以:
Real-Time Data
↓
State Change
↓
Cognitive Update
↓
Method Re-Evaluation
↓
Method Selection
方法评价本身也是一个动态认知过程。
28.13 方法评价的动态更新
可以定义:
MethodEvaluation(t)
=
F(
State(t),
Goal(t),
Condition(t),
Constraint(t),
Risk(t),
Capability(t),
Knowledge(t),
Experience(t)
)
当任何重要变量发生变化时:
State Change
↓
Condition Change
↓
Risk Change
↓
Capability Change
↓
Method Evaluation Update
因此,方法评价不是一次性计算。
它具有时间属性:
Evaluation(t1)
↓
Environment Change
↓
Evaluation(t2)
↓
Evaluation(t3)
↓
...
28.14 方法评价中的历史经验
人工个体不能只依赖当前理论计算。
历史执行结果同样会影响方法评价。
例如:
Method A
过去执行:
10次
成功:9次
失败:1次
那么历史经验可以成为当前方法评价的重要依据。
如果:
Method B
过去执行:
10次
成功:4次
失败:6次
即使B理论上可行,也应该降低其当前评价等级。
因此:
Historical Experience
↓
Method Performance
↓
Success Estimation
↓
Risk Estimation
↓
Current Method Evaluation
方法评价因此与学习系统、经验系统和记忆系统形成连接。
28.15 方法评价与失败学习
如果方法执行失败:
Method
↓
Execution
↓
Failure
↓
Failure Analysis
↓
Experience
↓
Method Evaluation Update
↓
Future Method Selection
这意味着失败并不是简单的错误结束。
失败会改变未来的方法评价。
例如:
Method A
过去评价:0.82
执行失败
↓
Failure Experience
↓
未来评价:0.55
相反,如果方法连续成功:
Method A
成功经验增加
↓
SuccessRate ↑
Confidence ↑
EvaluationScore ↑
因此:
方法评价是可以被经验持续修正的认知结构。
28.16 方法评价的完整认知链
综合第20—28章,可以得到:
WORLD
↓
PERCEPTION
↓
SCENE
↓
KNOWLEDGE
↓
COGNITION
↓
GOAL
↓
GOAL GAP
↓
CONDITION
↓
CONSTRAINT
↓
RISK
↓
CAPABILITY MATCHING
↓
DYNAMIC METHOD
↓
CANDIDATE METHODS
↓
FEASIBILITY EVALUATION
↓
SUCCESS RATE EVALUATION
↓
RISK EVALUATION
↓
COST EVALUATION
↓
METHOD COMPARISON
↓
METHOD RANKING
↓
METHOD SELECTION
↓
BEHAVIOR
↓
ACTION
↓
EXECUTION
↓
FEEDBACK
↓
EXPERIENCE
↓
LEARNING
↓
METHOD EVALUATION UPDATE
↓
RE-COGNITION
↺
这条链说明:
方法评价并不是独立模块,而是认知、能力、方法、执行和学习之间的连接机制。
28.17 方法评价的核心结构
可以进一步将第28章归纳为:
Method Space
│
┌───────┴───────┐
↓ ↓
Candidate A Candidate B
↓ ↓
Feasibility Feasibility
↓ ↓
Success Rate Success Rate
↓ ↓
Risk Risk
↓ ↓
Cost Cost
└───────┬───────┘
↓
Method Evaluation
↓
Method Comparison
↓
Method Ranking
↓
Method Selection
方法评价的本质就是:
将多个可能的方法转换成可以比较的认知结构。
28.18 方法评价与能力评价的区别
方法评价不能与能力评价混淆。
能力评价:
我有没有能力完成这类事情?
方法评价:
我现在采用哪一种方法完成这件事情更合适?
因此:
Capability Evaluation
↓
Can I do it?
而:
Method Evaluation
↓
How should I do it?
↓
Which method is better?
二者形成:
Goal
↓
Capability Matching
↓
Can I do it?
↓
Candidate Methods
↓
Method Evaluation
↓
Which way is better?
28.19 方法评价与行为生成
方法评价的结果最终会进入行为系统。
Method Evaluation
↓
Selected Method
↓
Behavior Generation
↓
Action Generation
↓
Execution
因此:
方法评价是认知与行为之间的重要决策桥梁。
如果方法评价错误,后面的行为即使执行正确,也可能得到错误结果。
所以人工个体的行为质量不仅取决于执行能力,还取决于方法评价质量。
28.20 方法评价模型的最终抽象
第28章可以建立一个统一抽象:
MethodEvaluation =
{
Method,
Goal,
CurrentState,
Conditions,
Constraints,
Feasibility,
SuccessRate,
Risk,
Cost,
ResourceRequirement,
TimeRequirement,
Stability,
Experience,
ExpectedResult,
Confidence,
Score
}
其中:
Method
↓
Evaluation Context
↓
Feasibility
↓
Success Probability
↓
Risk
↓
Cost
↓
Expected Result
↓
Overall Evaluation
最终产生:
Method Evaluation Result
这个结果再进入:
Method Selection
28.21 第28章与前面章节的关系
第20章:
什么是认知?
第21章:
认知当前场景中的什么?
第22章:
知识如何驱动认知?
第23章:
目标、条件、约束和风险如何限制认知?
第24章:
认知如何进行计算?
第25章:
认知如何实时更新?
第26章:
什么是方法?
第27章:
方法如何根据当前状态动态变化?
第28章:
多个方法出现之后,如何评价和比较?
因此形成完整递进:
Cognition
↓
Cognitive Computation
↓
Real-Time Cognition
↓
Method
↓
Dynamic Method
↓
Candidate Methods
↓
Method Evaluation
↓
Method Selection
28.22 核心结论
第28章建立了人工个体的方法评价机制。
候选方法定义当前可能的方法空间;
可行性判断方法在当前条件下能不能执行;
成功率判断方法完成目标的可能性;
风险判断方法可能造成的不利结果;
成本判断执行方法需要付出的资源、时间和恢复代价;
方法评价模型则把这些因素综合形成结构化评价结果。
因此:
方法评价是人工个体在多个候选方法之间进行认知比较的过程,它通过可行性、成功率、风险、成本、约束、资源、稳定性和历史经验等因素,对候选方法进行过滤、比较和排序,为方法选择提供认知依据。
其核心关系可以归纳为:
Candidate Methods
↓
Feasibility
↓
Success Rate
↓
Risk
↓
Cost
↓
Method Evaluation
↓
Method Ranking
↓
Method Selection
↓
Behavior
↓
Action
↓
Execution
↓
Feedback
↓
Experience
↓
Evaluation Update
↺
最终形成:
第27章让人工个体能够产生动态方法,第28章让人工个体能够评价动态方法。
进一步说:
动态方法解决“有哪些可能的做法”,方法评价解决“这些做法哪个更值得做”。
这使人工个体从“能够生成方法”进一步进入“能够判断方法”的阶段,为下一阶段的方法选择(Method Selection)以及后续的行为生成与动态执行建立认知基础。