P11R359-P11R363 / FROZEN DIAGNOSTICS

P11R244 冻结模型诊断

返回证据控制台

错误、概率与自动纠错

全部数字来自已冻结的 15,661 条折外预测。本页不进行新拟合、阈值选择或模型选择;P11R244 的性能结论和 P11R358 的科学停止均不改变。

P11R363 paired-HARPN gate 通过
Macro-F10.7053同协议领先保持
Beta-x F10.5502precision 0.4266
总体 ECE0.115710 个等宽区间
新增拟合0纯冻结诊断
ONE-VS-REST CALIBRATION

类别条件 ECE

每类概率分别采用 10 个等宽区间;数值越低,描述性校准误差越小。

类别项目前沿前沿−项目95% HARPN 区间
alpha0.040370.07341+0.03304[+0.01354,+0.04881]
beta · 主检验0.127960.19576+0.06780[+0.04510,+0.08691]
beta-x0.108430.12039+0.01196[−0.00678,+0.03235]
P11R363 / QWEN DECISION

配对不确定性与停止边界

Qwen 在重采样结果生成前冻结 5,000 次配对 HARPN 聚类自举。beta 主检验与 alpha 次级分析的区间高于零;beta-x 区间跨零。Qwen 选择保留该诊断,并要求在真正未见身份上预注册验证。

Qwen 已在 P11R362 看过点估计,因此这是事后描述基础上的探索性不确定性,不是盲法、预注册或独立确认;ECE 也不是分类性能指标。

CONFUSION MATRIX

真值行 × 预测列

真值 / 预测
alpha
beta
beta-x
alpha
3,883
778
155
beta
1,058
6,474
1,614
beta-x
49
334
1,316383 误分
CLASS METRICS

类别表现

Beta-x 的召回保持较高,但 precision 与 F1 仍是清晰的未来研究空间。

类别SupportPrecisionRecallF1
alpha4,8160.77820.80630.7920
beta9,1460.85340.70790.7738
beta-x1,6990.42660.77460.5502

混淆模式用于提出未来可证伪问题,不直接解释为太阳物理机制。

CALIBRATION

高置信区间

浅色为平均置信度,深色为实际准确率。

0.6-0.7
0.6510.571
0.7-0.8
0.7530.650
0.8-0.9
0.8560.729
0.9-1.0
0.9680.832

这里的总体 ECE 基于最大类别置信度;上方类别 ECE 基于 one-vs-rest 概率。两者回答不同问题,不能直接互相替代。

GROUNDING LOOP

解释纠错链

P11R359
拒绝:将 beta-x 误分数写成 973,并过早定位总体校准误差。
P11R360
失败关闭:上下文过大,模型在输出最终对象前耗尽额度。
P11R361
准入:紧凑事实卡返回正确数值 383,并承认总体 ECE 不可定位类别。
P11R362
推进:按登记的未来动作计算类别条件校准。
P11R363
推进:三次枚举包络失败均保留;Qwen 极小纠正后完成 5,000 次配对 HARPN 分析。
知识作用
错误、失败纠错、统计结果与 Qwen 停止边界全部入库,直接约束后续未见身份验证。