Новые ИИ‑модели клеток переосмысливают исследования клеточной биологии
Новые ИИ‑модели клеток переосмысливают исследования клеточной биологии
Исследователи из Стэнфордского медицинского университета представили две новые модели искусственного интеллекта для описания клеток. Первая модель, названная универсальным представлением клеток, стала основой для модели второго поколения — TranscriptFormer, которую обучили на данных по 112 миллионам клеток из 12 видов, от одноклеточных дрожжей до человека.
Модели клеток на основе ИИ упрощают сравнение клеток разных видов и открывают новые возможности для понимания болезней и разработки клеточных подходов в медицине.
«Мы пытаемся открыть совершенно новый способ мышления о клеточной биологии», — сказал Стивен Квейк, доктор философии, профессор биоинженерии. Вместе с Юре Лесковцем, доктором философии, профессором компьютерных наук, и Тео Каралетсосом, доктором философии, из Инициативы Чана Цукерберга он является соавтором двух статей об этой работе, недавно опубликованных в журналах Nature и Science. «Эти статьи знаменуют начало, как мы надеемся, совершенно новой области и десятилетий работы», — добавил Квейк.
Геном несёт инструкции для жизни, но современные исследования всё чаще фокусируются на экспрессии генов — на том, какие гены активны в конкретной клетке. Экспрессия генов показывает, какие белки и функции приписаны той или иной клетке.
Так, β‑клетки поджелудочной железы экспрессируют ген инсулина и другие гены, связанные с хранением и высвобождением гормона; В‑клетки крови производят антитела для борьбы с инфекциями; клетки кожи экспрессируют гены, связанные с образованием волос и пигмента. Различия в экспрессии помогают отличать типы клеток, а также различать здоровые и больные клетки и сопоставлять клетки разных видов.
За последние годы учёные создали «атласы» — базы данных с профилями экспрессии десятков тысяч генов для сотен миллионов клеток из множества видов.
Слишком много для человеческого мозга.
«Как мы думаем обо всех этих генах одновременно? Человеческий мозг не в состоянии осмысленно проанализировать такие объёмы данных. Эти модели помогают нам в этом: алгоритмы делают понятными очень сложные закономерности, которые человек не способен увидеть целиком», — сказал Квейк.
Стивен Квейк, доктор философии, профессор биоинженерии, Стэнфордский университет
TranscriptFormer обучали на данных 12 видов: помимо человека и дрожжей, в обучающую выборку вошли атласы клеток мышей, кроликов, кур, рыбок данио, плодовых мух, африканской шпорцевой лягушки, паразита, вызывающего малярию, морских ежей, губок и круглых червей Caenorhabditis elegans.
Процесс обучения был аналогичен подходу для больших языковых моделей: LLM многократно смотрят тексты с пропущенными словами и настраивают параметры до тех пор, пока не научатся предсказывать недостающие слова. TranscriptFormer применяет ту же идею, но вместо слов предсказывает значения или взаимосвязи в профилях экспрессии генов.
Квейк описывает итоговую модель как «универсальное пространство» — не физическое место, а математическое представление, которое позволяет измерять, насколько клетки похожи или различаются. «Все клетки каждого организма на Земле могут быть представлены в этом пространстве, и вы можете проанализировать их отношения друг с другом», — отметил он.
Одно из практических применений TranscriptFormer — изучение эволюционных связей между видами. Модель показала неожиданные сходства: например, хоаноцит — специализированная клетка губки — по профилю экспрессии генов оказалась близка к нейронам круглых червей и лягушек, что помогает прояснить эволюцию нейронных типов и роль хоаноцитов у губок. Другой пример: клетку губки, ранее описываемую как «нейроподобную», модель выявила более сходной по экспрессии с железистой клеткой лягушки, что указывает на возможную роль в пищеварении, а не в передаче нервных сигналов.
TranscriptFormer также может помогать при изучении новых видов: при подаче профилей экспрессии генов для вида, на котором модель не обучалась, она способна идентифицировать типы клеток. Авторы показали, что модель отличает здоровые и поражённые клетки.
В долгосрочной перспективе такие модели могут способствовать созданию новых клеточных методов лечения, в том числе за счёт выявления или моделирования функциональных клеток, которых пока не существует в природе.
«Мы надеемся, что это станет очень мощным инструментом для открытий», — сказал Квейк. «Это инструмент, который поможет опытным биологам думать о сложных проблемах».
В работе участвовали исследователи Инициативы Чана Цукерберга и BioHub. Соавторами статьи в Nature стали Янай Розен, докторант компьютерных наук в Стэнфорде, и Юсуф Рухани, доктор философии, ныне заместитель директора по машинному обучению в Arc Institute.
Исследование финансировалось Инициативой Чана Цукерберга, Агентством перспективных исследовательских проектов Министерства обороны, Национальным научным фондом, Стэнфордской инициативой по науке о данных, Wu Tsai Neurosciences Institute, Amazon, Genentech, GSK, Hitachi, Juniper Networks, KDDI и Американским словенским образовательным фондом.





