多肽发现正进入一个丰裕时代。研究人员可以构建更大的文库,引入非天然残基,以多种方式约束骨架,并利用日益强大的计算工具提出或排序候选分子。然而,许多项目仍围绕一个狭窄目标组织发现工作:找到最强的结合物。
亲和力很重要,但它不是药物特征。多肽还必须具备选择性、可溶性、合成可行性、足够的稳定性,并能到达相关的生物区室。根据项目需求,它可能需要跨膜、留在胞外、内化进入特定细胞类型,或在短暂暴露后维持活性。仅报告结合的筛选将这些难题留到后期,而那时改变分子方向的代价更高。
下一次进步不会来自选择实验筛选而非计算,或计算而非筛选。它将来自设计实验,使每一轮都能产生关于化学和生物景观的更具信息量的图谱。
文库本身就是假设的一部分
多肽文库从来不是真正无偏的。其长度分布、残基字母表、环化化学、拓扑结构、展示格式和合成方法决定了哪些分子可以被生产,哪些构象可以被探索。这些选择也影响稳定性、溶解度、渗透性和结合基团的呈现。
多肽功能并非仅由序列编码。两个残基组成相似的分子,当一个为线性而另一个为环状时,当立体化学改变时,或当骨架酰胺被修饰时,可能表现不同。对于受约束的多肽,连接位置和环拓扑可以重组构象集合。因此,仅基于序列的分析可能将化学和药理学上截然不同的分子归为一类。
近期工作展示了这一机会。一项2026年的研究筛选了15,360个完全随机的亚千道尔顿环肽,并鉴定出针对细胞内Keap1–Nrf2蛋白-蛋白相互作用的起点。迭代设计、合成和测试产生了一种在活细胞中有活性的膜渗透性抑制剂。更广泛的教训是,结合和渗透性可以被视为相互关联的设计问题,而非顺序障碍。
在生物空间中筛选,而不仅针对靶点
纯化蛋白筛选仍然有用,特别是在材料有限或通量至关重要时。但测定格式可能成为意外的选择压力。多肽可能识别纯化标签、表面、暴露的疏水斑块或天然环境中代表性不足的构象。高表观亲和力也可能反映非特异性相互作用,这些作用在另一种测定中消失。
解决方案不是强制每个初级筛选都进入复杂的细胞系统。而是在筛选开始前设计分阶段的测定层级。早期反筛选可以去除与标签、基质、相关蛋白或丰富脱靶结合的分子。竞争实验可以测试对预期表位的依赖性。同源反筛选可以揭示靶标家族内的选择性。
通过动力学结合、溶液相竞争、生化功能或细胞活性进行的正交确认,可以区分可重复的靶标结合与测定特异性行为。
对于细胞内项目,一旦候选数量允许,渗透性和功能活性就应进入工作流程。对于胞外靶点,血清稳定性、靶点周转、组织背景以及持续与短暂结合的后果可能更重要。目标不是立即测量每种属性,而是确保筛选级联反映分子最终必须发挥作用的环境。
大多数筛选读数都是快照。生物学不是。终点测量可能掩盖结合速率、解离速率、靶点再结合、内化、降解或细胞内保留的差异。一个平衡亲和力适中但解离速率慢的多肽,可能比解离迅速的高亲和力结合物产生更强的功能活性。相反,当脱靶相互作用带来风险时,长时间结合可能是不利的。
时间可以以实用方式纳入。通过延长洗涤时间或添加可溶性竞争物来增加选择压力。候选分子可以在血清、蛋白酶、还原条件或相关组织液中暴露定义时间后进行测试。细胞测定可以区分即时通路调节与洗涤后持续存在的活性。内化和胞质进入可以在多个时间点测量,而不是从一张图像推断。
逐轮富集也包含时间信息。稳步上升的序列可能比在瓶颈后突然出现的序列更可信。中间测序数据可以揭示早期富集、晚期伪影以及随选择压力变化而表现不同的架构家族。
保留分子失败的原因
最终命中列表通常是筛选数据集中信息量最少的部分。它包含赢家,但丢弃了理解它们为何获胜所需的大部分证据。
对于多肽项目,“无活性”不是单一标签。候选分子可能因为未被有效生产、未正确展示、未环化或以其他方式修饰、聚集、降解、非特异性结合、未能进入细胞,或到达靶点但未改变功能而失败。这些结果不应被合并为一个阴性类别。在这些数据上训练的模型将被要求从技术和药理学失败的混合物中学习生物学。
有用的数据集需要溯源信息。起始文库丰度、逐轮富集、对照行为、反筛选结果、合成产率、纯度、修饰效率、测定条件、批次身份和检测限应随每个序列一起传递。缺失值也需要解释。“未检测到”可能意味着低于测定阈值、不存在于起始群体中、在处理过程中丢失,或仅仅未被测试。
这种纪律改变了计算能做什么。模型不再预测单一结合分数,而是可以识别架构、亲和力、选择性、稳定性、渗透性、溶解性和合成性能之间的关系。它们还可以暴露不确定性,这对于选择下一个实验通常比看似自信的排序更有用。
基于物理的建模和机器学习常被呈现为竞争方法。在多肽发现中,当它们被赋予互补角色时更有用。
基于物理的计算可以检查构象集合、分子内氢键、溶剂暴露、靶点接触以及特定替换的后果。当实验数据稀疏或需要机制解释时,它们尤其有价值。其局限性包括计算成本、采样挑战和对底层模型的敏感性。
机器学习可以识别更大数据集中的关系,排序候选分子,提出人类团队可能不会优先考虑的组合,并支持多参数优化。近期工作将生成模型与贝叶斯优化以及前瞻性合成和测试相结合,以在实验定义的约束下改进多肽支架。深度学习方法在环肽结构预测和重新设计方面也变得越来越有能力,尽管有限的训练数据仍然是核心挑战。
最有效的工作流程利用物理洞察定义合理的化学空间,用实验数据锚定预测,并用机器学习识别下一个信息量最大的测量。优化不应将所有目标压缩为一个不透明的分数。团队应直接检查权衡:如果亲和力的适度损失能带来选择性、稳定性、渗透性或可制造性的重大提升,那可能是可以接受的。
在第一个命中之前建立学习策略
一个整合的多肽项目可以围绕五个决策组织。首先,尽早定义预期的产品特征。靶标区室、给药途径、剂量预期、选择性要求和最小功能效应应塑造筛选。
其次,使分子架构成为明确的变量。序列多样性很重要,但架构多样性同样重要。第三,预先指定反筛选和功能测定,以避免后期意外。第四,捕获所有数据及其溯源信息,包括失败原因。第五,将计算和实验整合到迭代循环中,每一轮都旨在最大化信息增益,而不仅仅是命中数量。
来源:GEN(英文原文,生物航编译,内容以原文为准)