由Meta首席执行官扎克伯格和妻子普莉希拉·陈(Priscilla Chan)创办的非营利机构Biohub 10月7日宣布,美国政府、Meta和谷歌母公司Alphabet加入Biohub的虚拟生物学计划(Virtual Biology Initiative),为训练生物研究用的人工智能模型建立公开数据集,这项计划的总投入因此达到十八亿美元。计划要测量细胞在比以往多得多的条件下怎样反应,再用这些数据建立预测模型,缩短现在要花好几年的药物开发时间;直接受益的是做药物研发和生物研究的人。
Meta、谷歌DeepMind和药物研发初创公司Isomorphic Labs共同投入三亿美元;美国能源部会在五年内投入超过五亿美元,用于实验室测量、建模和计算,这笔钱经由能源部牵头的跨部门计划“创世纪任务”(Genesis Mission)投入;美国国立卫生研究院会协调此前联邦政府投入超过五亿美元建成的数据集和数据库,由Biohub把它们标准化后用于训练AI。Biohub自己今年4月已经为这项计划投入五亿美元。艾伦研究所、博德研究所、格拉德斯通研究所、人类细胞图谱、人类蛋白质图谱和维康桑格研究所也参与组织这项计划。
| 出资方 | 投入 |
|---|---|
| Biohub | 5亿美元(今年4月) |
| 美国能源部 | 超过5亿美元(五年内) |
| 美国国立卫生研究院 | 协调此前超过5亿美元建成的数据 |
| Meta、谷歌DeepMind等三家公司 | 共3亿美元 |
数据:Biohub 10月7日公布
Biohub科学负责人里夫斯(Alex Rives)对媒体说,现有的细胞数据集有几亿个细胞,准确的预测模型需要几十亿个,最终要几万亿个。里夫斯说,这项工作原本要花几十年,合作各方希望压缩到五年,第一个数据集大约一年后就绪,并预计五年内会有准确的预测模型。
这些数据集最终会公开,但出钱的公司可以先用:里夫斯说,商业出资方的数据有一段暂不公开的期限,这些出资方可以先在数据上工作,期限过后数据才成为公开的科学资源;里夫斯还说,政府出资、同时进行的那部分工作没有这种限制。Biohub接下来还打算找制药公司和慈善机构出资。
其他人工智能公司也在做类似的事:Anthropic加码生物学研究,建了湿实验室;OpenAI基金会启动了一个超过一亿二千五百万美元的资助计划,资助用于AI研究的生物和医学数据集。
茉莉花观察
这一节是茉莉花的看法,依据是上文的事实。
我们的分析这项计划把联邦政府的钱和数据接到了一家私人慈善机构主导的AI项目上,能源部的五亿多美元走的是“创世纪任务”,国立卫生研究院拿出的是联邦已经花了五亿多美元建成的数据。数据最终公开,出钱的公司却能先用一段时间,谁出钱、谁先用,是这项开放科学计划里最实际的安排。
不同看法普莉希拉·陈对媒体说,这些数据一直被当作整个科学界的资产,不只属于某一个团体;里夫斯也说,政府出资的那部分工作没有暂不公开的期限。我们同意数据最终会公开;但五年内做出准确预测模型的目标,是里夫斯自己说原本要几十年的工作,时间表能否兑现还要看第一个数据集。
展望第一个数据集能不能在一年左右就绪。我们判断,到2027年12月31日,Biohub会宣布虚拟生物学计划的第一个数据集已经完成。里夫斯说第一个数据集大约一年后就绪,能源部和Biohub的钱都已经承诺到位,计划已于今年4月公布。现有的细胞数据集只有几亿个细胞,准确的预测模型需要几十亿、最终几万亿个,这十八亿美元要补的正是这个差距。
综合路透社、Bioengineer.org报道



