OpenAI在去年完成重组后,不仅为ChatGPT背后的公司建立了新的企业架构,也催生了一个潜在规模巨大的慈善力量——OpenAI基金会(OpenAI Foundation)。如今,该基金会将投入1.25亿美元,押注于日益强大的人工智能加速医学发现所必需的关键要素:更好的数据。
Public Data for Health计划启动
这项名为“Public Data for Health”的新计划将资助非营利组织和大学,用于构建、保存并向研究人员开放高质量科学数据集。首批受资助方包括OpenADMET、CTD Commons和北卡罗来纳大学(University of North Carolina),项目范围涵盖药物发现、监管知识以及个性化癌症疫苗。
OpenAI基金会生命科学与疾病治愈部门负责人雅各布·特雷弗森(Jacob Trefethen)表示:“随着AI进步,以及智能在生命科学和学术界变得更加丰富和广泛使用,数据的重要性只会继续上升。”其逻辑很直接:能力不断增强的AI模型或许能在海量生物信息中发现规律,但它们最终能发现什么,取决于可供其使用的观测数据。“AI进步的重要补充之一,实际上是对世界更多的观测,”特雷弗森说,“从这个意义上说,数据是发现的基础输入。”
开放数据,但有限制
可及性是该计划的核心原则。特雷弗森表示:“我认为共同的主线是可及性。确保我们资助的数据尽可能多地向尽可能多的研究人员开放,将是一个真正的重点。”但可及性并不一定意味着将所有数据集免费放到互联网上。特雷弗森说,合适的模式取决于所涉及的信息。一些科学数据集,例如蛋白质动力学测量数据,或许可以在生成后立即公开。人类数据则面临不同挑战。
基金会表示,由此产生的数据集将在保护隐私和个人同意的前提下,尽可能广泛地开放。特雷弗森称,基金会总体上遵循处理患者信息的大学和研究中心的专业知识和最佳实践,同时通过资助方角色保留监督权。受资助方“遵循与患者相关的任何数据的最佳实践”,目标是让信息“尽可能方便其他机构的研究人员获取,以便科学界能为患者取得最大进展……鉴于我们提供资助,我们在确保良好实践得到遵循方面发挥一定的治理作用,”他补充道。
癌症疫苗数据项目
首批项目之一将支持北卡罗来纳大学建立一项聚焦生成式免疫疗法的计划,包括可能改进个性化癌症疫苗的数据。此类疫苗可利用个体患者肿瘤的信息来识别新抗原(neoantigens)——即可能被免疫系统识别的异常蛋白——并设计疫苗,引导T细胞攻击癌症。
机器学习在这一过程中已很重要。“到目前为止,该领域取得进展的很大一部分是由机器学习实现的,”特雷弗森说,“它从肿瘤序列预测肿瘤外部将呈现什么,以及患者的T细胞将如何反应。”但仅靠序列数据不一定能揭示生物学上实际发生的情况。UNC项目旨在连接多个信息层面:对肿瘤测序、测量肿瘤细胞实际展示的蛋白质,以及确定患者免疫系统如何反应。“通过创建这种关联的多模态数据,我们认为能够推动整个领域向前发展,”特雷弗森说。
该项目体现了基金会优先关注的三大类别之一:关联数据(connected data),即结合不同生物学层面以提供更完整图景。另外两类是稀缺数据(scarce data),即难以获取或面临消失风险的宝贵信息;以及直接数据(direct data),即尽可能接近对患者重要现象的生物学和临床状态测量。
药物开发的数据难题
另一项资助将支持OpenADMET,该项目涉及加州大学旧金山分校(University of California, San Francisco)的研究人员,旨在改进对吸收、分布、代谢、排泄和毒性(ADMET)特性的预测,这些特性可帮助判断实验性药物最终成功还是失败。“他们将收集与ADMET特性相关的高质量数据,并开展这些盲测挑战,任何人都可以参加,”特雷弗森说。
这种方法在计算生物学中已有先例。诸如结构预测关键评估(CASP)等社区挑战赛提供了共同测试,用于评估相互竞争的计算方法,帮助推动了蛋白质结构预测的进步。特雷弗森表示,OpenADMET背后团队此前举办的一次竞赛吸引了300多名参赛者。“挑选能够全面解锁患者进展的问题,然后有针对性地收集高质量数据,是我们帮助整个领域的一种方式,”他说。
另一家首批受资助方CTD Commons将专注于保存和组织监管与药物开发知识,使该计划超越新生成的实验测量数据,延伸到可能碎片化或丢失的信息。
什么样的数据值1.25亿美元?
基金会有意将其对宝贵生物医学数据的定义保持宽泛。“我们试图在保持宽泛、向许多不同研究社区学习其所在生物学和生命科学领域最需要什么之间取得平衡,”特雷弗森说。一个考量因素是稀缺性。如果某个重要生物学或流行病学现象测量不足,围绕它创建严格数据集可能比在数据已丰富的领域生成更多观测产生更大的科学回报。“如果你能创建一个与之相关的高质量数据集,让每个人都能从中学习,那对我们来说会更有吸引力,”特雷弗森说。
基金会还对更上游的东西感兴趣:能够生成科学家目前尚无法轻易获得的生物学观测的技术。“分子生物学的哪些方面目前成像不佳?”特雷弗森问道,“生物学的空间方面哪些测量不足?”这可能包括新仪器、成像方法或实验方法,使以前无法触及的生物学现象变得可测量。“从根本上说,进步需要观测,”特雷弗森说,“我们确实会卡在所使用的设备上。”
一种新型科学资助者
Public Data for Health是OpenAI基金会慈善事业大规模扩张的一部分。特雷弗森表示,该组织打算在第一年通过其项目授予超过10亿美元的资助,并预计这一数额还会增加。“我们正试图以与高质量、严格决策相兼容的最快速度扩大资助规模,”他说。资助通常持续约两年,有时三年,根据规模每季度或每半年进行正式评估。特雷弗森说,基金会还打算在项目期间与受资助方保持非正式联系。
基金会仍在早期阶段确定其生命科学投资组合将变得多广。特雷弗森表示,它希望向研究人员学习,而不是过早决定哪些生物学领域最值得支持。这种雄心规模也使资金背后不寻常的组织变得重要。OpenAI于2015年12月作为非营利研究实验室成立。经过一系列重组,该非营利组织——现为OpenAI基金会——控制着OpenAI Group PBC,任命公司董事,并持有这家商业企业的大量股权。这种安排颠倒了企业基金会与其资助者之间熟悉的关系:非营利组织不受公司控制,而是控制公司。其财务资源也通过股权所有权与OpenAI Group的成功相关联。特雷弗森表示,基金会独立于OpenAI的商业运营开展慈善活动并做出资助决定。获得其资助的研究人员不需要使用OpenAI技术。“这是一项独立的慈善事业,我们的受资助者可以使用任何他们想要的AI模型。”
来源:Inside Precision Medicine(英文原文,生物航编译,内容以原文为准)