SYN / BIO

让下一次
测量更有价值

主动学习、预算与闭环

Day 06 / 07开始阅读

分数最高的,
总该先测吗?

今天怎么学 · 约 2 小时

35 分钟读正文,20 分钟拆解案例,45 分钟完成练习,20 分钟自测与复盘。

过关目标:比较相同预算的选样策略,解释不确定性与探索,并区分离线回放和前瞻验证。

如果只能再测三个候选,你会全部选择预测分数最高的吗?这取决于你最想得到高性能对象,还是更快了解系统。

模型预测完成后,还有一个决策问题:把有限资源分配给哪些候选。利用倾向于选择当前看起来更好的对象;探索倾向于获得对模型有帮助的新信息。两者可以结合,但探索不是盲目挑最奇怪的候选,也不意味着越不确定越值得测。

主动学习通常关心用更少标签改善模型;贝叶斯优化通常关心有限评价预算下找到更好的目标值。二者可能共享概率预测和选样方法,但目标并不完全相同。判断一种方法是否合适,先看它优化的是什么。[1]

实际决策还要考虑候选能否构建、测量是否可靠、能否并行以及反馈要多久。计算上最有价值的一个候选,如果根本无法评价,就不一定值得进入下一轮。预算应对应真实消耗单位,而不是仅记录模型调用次数。

不确定性,
需要有出处

偶然不确定性常与观测噪声等有关;认知不确定性与知识或模型不足有关。新增信息可能降低后者,但无法保证消除前者。在实际模型中,两者的区分需要假设,不能仅凭一个数值名称就认定估计可信。

概率模型、模型集合或其他方法可以给出不确定性估计。校准关注报告的概率或区间与实际频率是否相符,例如声称 90% 的预测区间,在适用数据上是否接近覆盖 90% 的观测。校准也依赖测试分布,不能自动保证分布外可靠性。

语言模型写下“我有 95% 信心”并不是 assay 误差模型,也不是经过校准的预测区间。同样,序列距离可以提醒我们某个对象离已知样本较远,却不能直接等同于概率意义的不确定性。

采集函数把预测、探索偏好等信息转为选样标准。即使采用成熟方法,也需要说明目标、可行域、批量规则和噪声处理。今天使用一个刻意简单的距离加分启发式,目的只是比较策略,不把它称作完整贝叶斯优化。

在同一预算下,
重放一次决策

模拟标签回放 · 不是新实验验证

随机选,还是模型引导?

每个种子使用同一初始标注集、同一候选池和 6 次选样预算。每次选择后才揭示该候选的标签并重新拟合。最终留出集不参与选样。

模型策略使用线性预测 + 到已标注特征的距离奖励。距离奖励只是探索启发式,不是校准的标准差;所有结果仅在这个合成候选池内成立。

比较策略必须公平:初始信息、候选池、预算和终测规则相同。随机策略要用多个固定种子展示波动,不能只挑某一条最好看的运行轨迹。若某策略更复杂,还应说明计算和实际测量成本是否可比。

图中的“已发现最好分数”回答当前拿到了多好的对象;终测 MAE 回答模型预测如何。改善其中一个,不保证改善另一个。这也是为什么主动学习与目标优化不能只用一个含糊的“效率”指标概括。

候选的完整标签由模拟器持有,但选择函数只接收特征、已揭示标签和预先固定的规则。若选样代码偷看未测标签,曲线再漂亮也只是信息泄漏。检查信息在何时可用,是闭环代码审查的关键。

离线回放留下了什么空白

历史或模拟数据里的候选池是固定的;现实中可能会出现构建失败、测量缺失、新环境与成本变化。离线回放无法证明新设计的真实表现,也不能反映未记录的实验选择偏差。需要前瞻验证,才能观察策略如何应对新的实验反馈。

停止条件也应该提前写下:例如预算耗尽、改进小于可区分的噪声范围,或可行候选不足。不要只写“继续直到找到最好”,因为真实设计空间通常无法穷尽,最优值也往往未知。

把理解,
留在一份记录里

运行回放,比较三个种子的预算—最好分数曲线,以及两种策略的终测 MAE。任选一次策略差异,写出可能解释;再列出至少三个模拟器没有覆盖的真实实验问题。用脚本复现同一过程。

尚未填写
完成后,再看示例

三个种子分别比较相同初始样本。即便模型策略找到更高分数,也只能说明在该模拟候选池与预算下的结果。构建失败、测量延迟和分布变化尚未被模拟,不能据此承诺实验提效比例。

带走三个判断

01距离已标注样本很远,就等于有校准的不确定性吗?
02比较选样策略,哪项是必要条件?
03离线回放变好,是否完成了前瞻实验验证?

回到一手资料

本章图解与练习为原创教学设计,数值演示均为模拟;来源支持相应基础与方法,不代表对教学参数的实证验证。

  1. ART · 原始研究全文 ↗

    概率预测、推荐、探索与工程迭代的原始案例。

  2. EBRC · DBTL ↗

    将学习与下一轮设计连接。

资料复核:2026-09-11。外链需要联网;部分文献仅核对摘要或可访问正文,完整范围见 SOURCES.md。

Day 06 / 07

让下一步,
有依据。

带着今天的记录进入下一天,把局部理解接回完整的研究问题。