Новые ИИ‑модели клеток переосмысливают исследования клеточной биологии

Исследователи из Стэнфордского медицинского университета представили две новые модели искусственного интеллекта для описания клеток. Первая модель, названная универсальным представлением клеток,
  • РАЗМЕР ШРИФТА
  • просмотровсегодня: 3 всего: 3
  • комментариев: 0добавить коментарий

Исследователи из Стэнфордского медицинского университета представили две новые модели искусственного интеллекта для описания клеток. Первая модель, названная универсальным представлением клеток, стала основой для модели второго поколения — TranscriptFormer, которую обучили на данных по 112 миллионам клеток из 12 видов, от одноклеточных дрожжей до человека.

Модели клеток на основе ИИ упрощают сравнение клеток разных видов и открывают новые возможности для понимания болезней и разработки клеточных подходов в медицине.

«Мы пытаемся открыть совершенно новый способ мышления о клеточной биологии», — сказал Стивен Квейк, доктор философии, профессор биоинженерии. Вместе с Юре Лесковцем, доктором философии, профессором компьютерных наук, и Тео Каралетсосом, доктором философии, из Инициативы Чана Цукерберга он является соавтором двух статей об этой работе, недавно опубликованных в журналах Nature и Science. «Эти статьи знаменуют начало, как мы надеемся, совершенно новой области и десятилетий работы», — добавил Квейк.

Геном несёт инструкции для жизни, но современные исследования всё чаще фокусируются на экспрессии генов — на том, какие гены активны в конкретной клетке. Экспрессия генов показывает, какие белки и функции приписаны той или иной клетке.

Так, β‑клетки поджелудочной железы экспрессируют ген инсулина и другие гены, связанные с хранением и высвобождением гормона; В‑клетки крови производят антитела для борьбы с инфекциями; клетки кожи экспрессируют гены, связанные с образованием волос и пигмента. Различия в экспрессии помогают отличать типы клеток, а также различать здоровые и больные клетки и сопоставлять клетки разных видов.

За последние годы учёные создали «атласы» — базы данных с профилями экспрессии десятков тысяч генов для сотен миллионов клеток из множества видов.

Слишком много для человеческого мозга.

«Как мы думаем обо всех этих генах одновременно? Человеческий мозг не в состоянии осмысленно проанализировать такие объёмы данных. Эти модели помогают нам в этом: алгоритмы делают понятными очень сложные закономерности, которые человек не способен увидеть целиком», — сказал Квейк.

Стивен Квейк, доктор философии, профессор биоинженерии, Стэнфордский университет

TranscriptFormer обучали на данных 12 видов: помимо человека и дрожжей, в обучающую выборку вошли атласы клеток мышей, кроликов, кур, рыбок данио, плодовых мух, африканской шпорцевой лягушки, паразита, вызывающего малярию, морских ежей, губок и круглых червей Caenorhabditis elegans.

Процесс обучения был аналогичен подходу для больших языковых моделей: LLM многократно смотрят тексты с пропущенными словами и настраивают параметры до тех пор, пока не научатся предсказывать недостающие слова. TranscriptFormer применяет ту же идею, но вместо слов предсказывает значения или взаимосвязи в профилях экспрессии генов.

Квейк описывает итоговую модель как «универсальное пространство» — не физическое место, а математическое представление, которое позволяет измерять, насколько клетки похожи или различаются. «Все клетки каждого организма на Земле могут быть представлены в этом пространстве, и вы можете проанализировать их отношения друг с другом», — отметил он.

Одно из практических применений TranscriptFormer — изучение эволюционных связей между видами. Модель показала неожиданные сходства: например, хоаноцит — специализированная клетка губки — по профилю экспрессии генов оказалась близка к нейронам круглых червей и лягушек, что помогает прояснить эволюцию нейронных типов и роль хоаноцитов у губок. Другой пример: клетку губки, ранее описываемую как «нейроподобную», модель выявила более сходной по экспрессии с железистой клеткой лягушки, что указывает на возможную роль в пищеварении, а не в передаче нервных сигналов.

TranscriptFormer также может помогать при изучении новых видов: при подаче профилей экспрессии генов для вида, на котором модель не обучалась, она способна идентифицировать типы клеток. Авторы показали, что модель отличает здоровые и поражённые клетки.

В долгосрочной перспективе такие модели могут способствовать созданию новых клеточных методов лечения, в том числе за счёт выявления или моделирования функциональных клеток, которых пока не существует в природе.

«Мы надеемся, что это станет очень мощным инструментом для открытий», — сказал Квейк. «Это инструмент, который поможет опытным биологам думать о сложных проблемах».

В работе участвовали исследователи Инициативы Чана Цукерберга и BioHub. Соавторами статьи в Nature стали Янай Розен, докторант компьютерных наук в Стэнфорде, и Юсуф Рухани, доктор философии, ныне заместитель директора по машинному обучению в Arc Institute.

Исследование финансировалось Инициативой Чана Цукерберга, Агентством перспективных исследовательских проектов Министерства обороны, Национальным научным фондом, Стэнфордской инициативой по науке о данных, Wu Tsai Neurosciences Institute, Amazon, Genentech, GSK, Hitachi, Juniper Networks, KDDI и Американским словенским образовательным фондом.





Комментарии
close

Добавить комментарий





максимум 1500 символов



Другие новости медицины

ещё 7 новостей
more