全部数字来自已冻结的 15,661 条折外预测。本页不进行新拟合、阈值选择或模型选择;P11R244 的性能结论和 P11R358 的科学停止均不改变。
每类概率分别采用 10 个等宽区间;数值越低,描述性校准误差越小。
| 类别 | 项目 | 前沿 | 前沿−项目 | 95% HARPN 区间 |
|---|---|---|---|---|
| alpha | 0.04037 | 0.07341 | +0.03304 | [+0.01354,+0.04881] |
| beta · 主检验 | 0.12796 | 0.19576 | +0.06780 | [+0.04510,+0.08691] |
| beta-x | 0.10843 | 0.12039 | +0.01196 | [−0.00678,+0.03235] |
Qwen 在重采样结果生成前冻结 5,000 次配对 HARPN 聚类自举。beta 主检验与 alpha 次级分析的区间高于零;beta-x 区间跨零。Qwen 选择保留该诊断,并要求在真正未见身份上预注册验证。
Qwen 已在 P11R362 看过点估计,因此这是事后描述基础上的探索性不确定性,不是盲法、预注册或独立确认;ECE 也不是分类性能指标。
Beta-x 的召回保持较高,但 precision 与 F1 仍是清晰的未来研究空间。
| 类别 | Support | Precision | Recall | F1 |
|---|---|---|---|---|
| alpha | 4,816 | 0.7782 | 0.8063 | 0.7920 |
| beta | 9,146 | 0.8534 | 0.7079 | 0.7738 |
| beta-x | 1,699 | 0.4266 | 0.7746 | 0.5502 |
混淆模式用于提出未来可证伪问题,不直接解释为太阳物理机制。
浅色为平均置信度,深色为实际准确率。
这里的总体 ECE 基于最大类别置信度;上方类别 ECE 基于 one-vs-rest 概率。两者回答不同问题,不能直接互相替代。