# 7 天知识框架：从序列到系统

## 学习约定

目标是建立继续研究与计算实践的入口。每天约 120 分钟：正文与图解 35 分钟、案例拆解 20 分钟、计算/纸笔练习 45 分钟、自测与复盘 20 分钟。选读不计入必修时间。

先修诊断：能否解释 DNA/RNA/蛋白质的基本关系、理解基因与表型的区别、用 Python 读取表格、区分训练集和测试集？前两项不足时先读 Day 1 的复习页；后两项不足时用预制表格与已运行结果完成第一轮，再补 Python。

已确认学习方向：先建立全景，不提前专攻某条应用路线。Day 1 用应用地图并列呈现基因调控、蛋白工程、细胞工厂、无细胞系统与自动化闭环，比较它们的设计对象、数据和验证条件。

建模练习以**蛋白序列—功能教学任务**为背景。首版的真实 GFP 文件级许可尚未核验完成，因此必修演示采用明确标注的合成短片段与模拟分数；真实数据作为选读入口，核验后才迁移分析。荧光读数与酶催化性能不是同一个目标，案例结果不能直接推广为酶工程结论。

该数据案例仅用于把数据审查、预测与选样串起来，不代表优先发展蛋白工程。基因调控和代谢工程各有独立练习；Day 7 再比较路线适配度。

## 总览

| 天 | 主问题 | 生物学底座 | AI 工程连接 | 当天产出 |
|---|---|---|---|---|
| 1 | 我们到底在设计什么？ | 信息流、宿主、基因型与表型 | 明确输入、干预、输出与上下文 | 一页系统图 |
| 2 | 生物系统为什么不能像代码一样直接组合？ | 调控、表达、反馈、资源竞争 | 机制模型、约束、可观测性 | 调控曲线与变量表 |
| 3 | 这个标签能信吗？ | 测量、对照、重复、批次 | 数据质量、泄漏、切分设计 | 数据卡与切分规则 |
| 4 | 序列能预测功能吗？ | 变异、结构与功能 | 表征、基线、泛化 | 一个可解释基线与评估图 |
| 5 | 局部变好为何整体没变好？ | 代谢、通量、化学计量、宿主负担 | 约束建模与多目标优化 | 小网络约束分析 |
| 6 | 下一轮应该测什么？ | DBTL、验证预算、实验信息 | 不确定性、主动学习、探索/利用 | 一次回放与候选策略说明 |
| 7 | 怎样把模型变成可验证的项目？ | 实验验证、系统整合与可重复性 | 科学与工程验收、成本和失败标准 | 两页项目简报 |

## Day 1 · 从分子到可设计的系统

**达成目标**：把应用愿望转写成“对象—干预—宿主/环境—测量—成功标准”，解释合成生物学与仅分析生物数据的差别。

必修：DNA、RNA、蛋白质；转录与翻译；基因、序列变体、基因型、表型；细胞与宿主；表达和功能的区别；设计—构建—测试—学习（DBTL）。中心法则作为基础信息流框架介绍，不描述成无例外的简单箭头。

核心图：全景应用地图 + 序列 → 表达 → 蛋白产物 → 测量表型，宿主与环境从侧面影响多个环节。标出“设计变量”“不可控扰动”“观察值”。

练习：以荧光蛋白为例，列出模型看到的序列、实验记录的荧光、影响读数的表达量/折叠/测量条件；对比“预测序列功能”和“提出下一轮候选”两个任务。

产出：一页系统图与一段问题定义。自测：为什么同一序列可能有不同读数？为什么高表达不等于目标功能更好？AI 预测接入 DBTL 哪一环？

过关：能列出至少两个序列以外的影响因素，并区分预测与实际干预。

选读：细胞区室、染色体与质粒、常用宿主差异、无细胞系统；不要求记忆具体实验操作流程。

## Day 2 · 元件、调控与系统行为

**达成目标**：理解设计的功能依赖上下文，避免把生物元件当作完全可互换的软件组件。

必修：启动子、调控序列、编码序列、终止子；原核/真核表达架构差异；转录因子、诱导、抑制、反馈；剂量响应、动态范围、噪声和宿主负担。RBS 作为原核语境中的例子，不能泛化为所有表达系统。

核心图：输入信号—调控—表达输出的关系，旁边展示资源竞争与宿主状态的影响。

练习：在预制的 Hill 响应教学模型里改变阈值与斜率，观察“输入更多”何时不再带来明显收益；写清模型是假设关系，不是任何真实系统的通用定律。可用网页滑块或简单 Python 完成。

AI 连接：什么可以当特征，什么是隐藏变量；静态拟合为什么不能替代动态稳定性或因果分析。

产出：响应曲线、变量表、两个模型局限。自测：相同元件换宿主为何可能失效？反馈如何改变系统行为？调节表达强度为何可能有代价？

过关：能说出至少一个元件层面与系统层面的权衡。

## Day 3 · 测量、实验设计与可信数据

**达成目标**：训练前能审查标签来源，提出与使用场景一致的划分方式。

必修：assay、单位、检出范围、对照、生物学重复与技术重复、批次效应、混杂、测量噪声；剂量/时间条件；测序与深度突变扫描（DMS）的概念；DMS 中的 fitness score 含义由具体实验定义。

核心图：真实状态 → 测量流程 → 原始读数 → 归一化标签，逐层标出可能损失或引入的信息。

练习：检查预制小表的重复记录、缺失值、批次、单位和变体命名；把同一变体的重复测量放在同一分组，避免跨训练/测试泄漏。讨论同源性分组、按突变距离外推、按时间/批次留出分别回答什么问题。

AI 连接：随机切分不必然错误，但不能自动代表对远缘蛋白、新骨架或新实验条件的泛化。归一化和特征拟合只使用训练数据；测试集不用于选择模型。

产出：数据卡，记录一行代表什么、目标单位、重复关系、来源、许可、筛选规则、划分依据和已知偏差。

自测：技术重复可否当独立生物样本？“活性”能否跨 assay 直接合并？高随机测试分数能否支持新蛋白设计？

过关：能指出一个明确泄漏路径，并给出对应的分组/留出方案。

## Day 4 · 序列—结构—功能与最小预测模型

**达成目标**：完成一个小规模基线，并解释预测结果在什么条件下可信。

必修：氨基酸、变异、蛋白结构层次、折叠与功能、表观相关与机制；单突变与组合突变、上位性；序列相似性与适用域。

AI 连接：one-hot、简单序列特征、蛋白语言模型 embedding；回归与排序任务；预训练不等于自动获得目标功能标签。结构预测不是活性、表达量或可制造性的替代测量。

练习：复用 Day 3 的分组划分，在小数据上比较训练集均值预测与一个线性/岭回归基线。基础模型用 CPU；现成 embedding 对比作为选做，不要求下载大模型。先划分再拟合，保留一个最小可运行自检。

评价：至少用 MAE 与预测—观测图；若任务是候选排序，再报告 Spearman 或固定预算下的 top-k 表现。解释各指标解决的问题，不能仅给一个分数。样本不足时明确误差不稳定。

产出：可重跑脚本、划分说明、指标表、残差图与失败案例。

自测：平均误差小是否一定能选出最优候选？为什么需要简单基线？序列相似性会怎样影响测试难度？

过关：模型确实与常数基线比较，并写明对新骨架/新条件的限制。模型未赢过基线也可过关，正确解释失败比修饰结果更重要。

## Day 5 · 代谢与细胞工厂：从局部到整体

**达成目标**：理解细胞工厂受守恒关系与多目标约束，能区分不同层级的问题。

必修：酶与反应、代谢通路、化学计量、代谢通量、辅因子、能量、稳态近似；生长与产物分配；滴度、产率、生产强度/生产率必须区分并注明单位。

核心图：底物输入在生长、目标产物和副产物之间分配。说明单个酶性能提高不保证系统产量提高。

练习：对预制 4–6 条反应的小网络列出物料平衡与通量上下界，用图解或给定求解结果比较两种约束场景。FBA 的核心是约束下优化，不要求首周推导完整优化算法或安装大型模型。

AI 连接：机制约束模型与纯数据预测的互补；代理模型、多目标优化、放大过程中的分布变化。FBA 常用稳态假设不能直接预测时间轨迹，目标函数是建模选择。

产出：小网络图、约束表、一段“为何局部改进没有提升整体目标”的分析。

自测：浓度与通量有什么区别？滴度高意味着产率高吗？模型最优解是否就是实际细胞状态？

过关：能正确区分至少两种生产指标，并指出稳态模型的一个限制。

选读：COBRA 工具、全基因组代谢模型、动态模型；根据实际项目再展开。

## Day 6 · 闭环学习：下一轮测什么

**达成目标**：将“选预测最高的候选”升级为有预算、有基线、有验证意识的决策策略。

必修：DBTL 闭环、验证预算、反馈延迟、噪声、探索与利用、多样性、可行性约束；测量不确定性与模型不确定性的区别。

AI 连接：主动学习与贝叶斯优化的用途差异；前者常关注学习效率，后者常关注有限预算下优化目标，两者可有重叠。不确定性估计需要检查校准，不能把语言模型口头“置信度”当实验依据。

练习：在教学数据中隐藏一部分标签，以相同初始样本和预算比较随机选择与模型导向选择；揭示选中样本的已有标签后重新拟合。保留最终评估集不参与选样；用几个固定随机种子展示波动。若采用纯合成函数，所有图明确标注“模拟”。

此练习是历史数据回放；候选池覆盖、历史采样偏差与缺少新实验意味着它不能证明真实闭环收益。

产出：预算—效果曲线、候选选择理由、停止条件，以及回放结果不能支持的结论。

自测：为何不总是选预测最高的候选？高不确定性候选是否总值得测？离线回放提升能否代表湿实验成功？

过关：公平比较相同预算的策略，并能解释数据回放与前瞻实验的区别。

## Day 7 · 从 notebook 到研究与应用方案

**达成目标**：提出能被实验合作者和工程团队共同审查的项目，而不只展示模型指标。

必修：目标产品/用途、真实可控变量、数据可用性、外部验证、前瞻验证、复现、成本、吞吐、周期、宿主/测量约束；把适用的实验室条件和审查要求作为实际项目依赖记录。

练习：先用“兴趣、可获得数据、验证资源、反馈周期”比较蛋白工程、调控设计、代谢工程与实验自动化，再任选一条作为假设性项目，不要求在结课时锁定职业方向。用前六天的产出写两页项目简报：

1. 问题、目标表型、使用者与预期决策。
2. 生物学机制假设与可控设计空间。
3. 数据来源、测量条件、许可、偏差和切分。
4. 基线、拟用模型、指标与适用域。
5. 验证路径：离线 → 独立数据/条件 → 合作环境中的前瞻验证。
6. 预算单位、计算/实验成本、成功阈值和停止条件。
7. 失败风险与下一步需要的专业知识或资源。

成功阈值根据具体目标与测量噪声制定，不预填“提升 20%”等没有依据的数值。区分科学目标、模型指标和业务指标，说明它们如何相连。

结业评估（自评，每项 0–2 分）：问题是否明确；机制与测量是否合理；数据与划分是否可信；基线与评价是否匹配；验证与成本是否可执行。建议 8/10 且数据/验证两项均不为 0 后再进入深入项目。这是教学标准，不是行业能力认证。

## 后续路线

蛋白/酶工程：补结构与生物化学、序列泛化评估、DMS 数据语义和多目标设计。

代谢/生物制造：补代谢网络、约束建模、过程数据、规模变化与工艺目标。

实验自动化与闭环：补实验设计、测量校准、样本追踪、批次调度与反馈延迟。

无论走哪条路线，下一阶段优先完成一个小型、可复现、带失败分析的公开数据项目，再扩大模型或接入真实实验。

## 资料使用

本框架是针对学习目标的教学设计，日程与练习安排不是来源材料的原有课程。基础事实和方法依据见 [来源清单](SOURCES.md)。正文制作时还需给各项具体科学论断补齐段落级引用、图示出处与数据许可。
