SYN / BIO

先读懂
一个测量值

从实验读数到可信数据

Day 03 / 07开始阅读

一个数字,
经过了多少道门?

今天怎么学 · 约 2 小时

35 分钟读正文,20 分钟拆解案例,45 分钟完成练习,20 分钟自测与复盘。

过关目标:完成一张数据卡,找出重复、缺失与单位问题,并说明划分方式检验哪种泛化。

表格里写着“活性 0.8”。这个标签看起来可以直接训练,但如果不知道它怎样测得,0.8 可能没有可比较的含义。

测定把真实样本变成读数,数据处理再把读数变成标签。样本背景、取样时间、仪器量程、背景扣除和归一化都可能改变最后的数字。建模前需要理解这条链,而不是只检查 CSV 能否读入。

样本状态测量与仪器原始读数校正与归一化模型标签

先问“一行是什么”。它可能是一条序列的一次技术测量,也可能是多个样本的平均值,或一次筛选后由计数估计出的分数。这些行并不自动具有相同统计地位。平均过的数值还应保留样本数与离散程度,否则难以判断可靠性。

深度突变扫描(DMS)通常通过高通量方式测量许多变体在特定体系下的表现。数据里的 fitness score 不一定是自然环境中的生存适应度,更不能不看定义就当成统一的“蛋白活性”。先读原始 assay 描述,再读字段名。[2]

测序可以帮助识别或计数变体,但从序列计数到功能分数,通常还有特定实验与统计处理。输入序列相同,并不意味着来自不同测定的标签可以直接拼接。目标、单位和背景不同,可能需要分开建模。

重复、对照
与批次

技术重复是对同一生物样本重复测量,用于了解部分测量变异;生物学重复来自独立生物样本,用于估计样本层面的变化。重复次数不是唯一重要的信息,独立性来自实验单位和流程,而不是把同一条记录复制几次。

对照使结果有比较基准。背景或阴性对照帮助判断信号底线;参考样本可用于监测测量漂移。对照不必然消除所有偏差,但缺少对照时,跨时间或跨批次比较往往更难解释。

批次效应是由实验日期、试剂、操作者、仪器等成组条件造成的系统差异。如果高性能候选全在第二批测,候选类型和批次就混杂了。模型可能学到批次差异,却被误认为学到了生物机制。

随机化使未知干扰更不容易系统地偏向一组;区组设计则把已知干扰因素组织进比较。它们是实验设计手段,不是事后随意打乱表格顺序。实施时还需考虑真实实验单位与可操作约束。[1]

噪声、缺失与量程也要记录。低于检出限不一定等于零;饱和读数不能准确区分更高的真实值;测量失败可能与某类样本有关,简单删除这些样本会改变数据分布。清洗时应保留处理原因和原始记录。

先说泛化目标,
再切数据

数据泄漏发生在评估中不该可用的信息进入训练或模型选择时。同一变体的重复测量被分到训练和测试,就是常见路径:模型见过几乎相同的对象,测试分数却被解释为对新对象的能力。

模拟记录 · 故意保留重复关系

这一次,测试集真的独立吗?

分组只能解决与该分组对应的问题。按变体分组,并不能保证对远缘蛋白、全新骨架或新宿主有效。若部署时要面对这些变化,测试设计也应尽量覆盖对应的隔离条件,例如按家族、骨架、时间或实验条件留出。

随机切分并非一概错误。它回答的是从相近数据分布中抽取新样本时的表现;如果这就是使用场景,它可能合理。问题出在把这个结论扩展到没有测试过的场景。测试集的含义,比“测试占 20%”更重要。

还应把数据预处理放进正确边界:用训练集拟合标准化参数和特征选择,验证集用于调参,最终测试集留到模型方案固定后评估。反复看测试结果再修改方案,会让测试集逐渐变成验证集。[3]

今天不用急着修出漂亮分数。只要能说清一行是什么、标签怎样产生、划分检验什么,你已经为明天的模型做了最重要的准备。

把理解,
留在一份记录里

下载审查表,标出一条完整重复记录、一个缺失值和一处单位不一致。不要直接删除:逐项写出处理决定与理由。再查看后续建模用的模拟数据,记录变体与重复测量的关系,提出切分方案。

尚未填写
完成后,再看示例

审查表 v01 的同一技术重复被完整复制,应先核对来源;v02 的 score 为空,不能默认补零;v03 使用 %,不能与 a.u. 直接合并。按 variant_id 分组避免同一变体跨集合,但仍不证明跨蛋白骨架泛化。

带走三个判断

01把一个样本测十次,是否得到十个独立生物学重复?
02按变体分组的测试,自动证明对新蛋白家族有效吗?
03标准化均值应先用哪个集合估计?

回到一手资料

本章图解与练习为原创教学设计,数值演示均为模拟;来源支持相应基础与方法,不代表对教学参数的实证验证。

  1. NIST · Randomized Block Designs ↗

    区组、已知干扰因素与比较设计。

  2. ProteinGym · 数据说明 ↗

    DMS 数据字段、assay 元数据与任务区别。

  3. DOME · 作者预印本 ↗

    生物机器学习的数据、优化、模型与评价报告。

资料复核:2026-09-11。外链需要联网;部分文献仅核对摘要或可访问正文,完整范围见 SOURCES.md。

Day 03 / 07

让下一步,
有依据。

带着今天的记录进入下一天,把局部理解接回完整的研究问题。