Десять больниц хотят вместе обучить ИИ-модель для диагностики болезни по снимкам: у каждой свой архив, в одиночку данных не хватает, вместе — хватило бы. Только сложить эти данные на одном сервере нельзя: персональная медицинская информация по закону не покидает больницы, а карты пациентов не должны видеть конкуренты.
Если совсем коротко, федеративное обучение — это способ обучить общую модель машинного обучения сразу на данных нескольких владельцев, не объединяя сами данные в одно хранилище. Алгоритм собирает с каждой машины не записи пациентов, а только результаты их статистической обработки — настроенные параметры модели. Получается совместный научный результат без совместного датасета: и юридически чисто, и этически безопасно.
Федеративное обучение переворачивает схему: вместо того чтобы данные ехали к модели, модель едет к данным. Каждая больница обучает копию общей модели на собственных снимках и отправляет на сервер только обновлённые веса (несколько мегабайт), а не сами снимки. Сервер усредняет веса и рассылает обновлённую модель обратно. Цикл повторяется десятки раз. Подход впервые применил Google в 2017-м для клавиатуры Gboard на Android: модель тогда научили угадывать следующее слово по сообщениям, а сами сообщения с телефона при этом не выгружаются. Сегодня по той же схеме могут работать банки, автопроизводители, заводы, образовательные платформы — везде, где данные ценны вместе, но раздавать их по отдельности нельзя.
Один раунд федеративного обучения:
Десять больниц в итоге получат общую диагностическую модель, обученную на снимках всех вместе, — и при этом ни один пациент не «утечёт» наружу. То же в ближайшие 3–5 лет повторится в банках, на заводах, в образовании — везде, где данные ценны вместе, а делиться ими нельзя. Открытыми остаются вопросы приватности без потери точности и устойчивости при тысячах узлов — каждый открывает поле для исследований.
Сергей Ермаков, старший преподаватель кафедры Инструментального и прикладного программного обеспечения Института информационных технологий МИРЭА — Российского технологического университета
Если совсем коротко, федеративное обучение — это способ обучить общую модель машинного обучения сразу на данных нескольких владельцев, не объединяя сами данные в одно хранилище. Алгоритм собирает с каждой машины не записи пациентов, а только результаты их статистической обработки — настроенные параметры модели. Получается совместный научный результат без совместного датасета: и юридически чисто, и этически безопасно.
Федеративное обучение переворачивает схему: вместо того чтобы данные ехали к модели, модель едет к данным. Каждая больница обучает копию общей модели на собственных снимках и отправляет на сервер только обновлённые веса (несколько мегабайт), а не сами снимки. Сервер усредняет веса и рассылает обновлённую модель обратно. Цикл повторяется десятки раз. Подход впервые применил Google в 2017-м для клавиатуры Gboard на Android: модель тогда научили угадывать следующее слово по сообщениям, а сами сообщения с телефона при этом не выгружаются. Сегодня по той же схеме могут работать банки, автопроизводители, заводы, образовательные платформы — везде, где данные ценны вместе, но раздавать их по отдельности нельзя.
Один раунд федеративного обучения:
- Координатор раздаёт узлам текущую модель. Выбирает участников раунда (например, 5 из 10) и присылает каждому актуальные веса по защищённому сетевому каналу (gRPC поверх TLS, для слабых линий — MQTT).
- Узел дообучает модель на своих данных. Локально, обычным ML-фреймворком (PyTorch, TensorFlow, JAX).
- Узел подмешивает в обновлённые веса немного случайного шума. Шум калиброван: по итоговой модели не выяснить, лежали ли там данные конкретного человека, а общая закономерность всё равно выучивается. Это называется дифференциальной приватностью.
- Узел шлёт координатору только веса — не сами данные. Несколько мегабайт чисел вместо терабайтов исходников.
- Координатор складывает обновления так, что не видит вклад отдельного узла — только общую сумму. Защита от любопытства самого сервера. Защищённая агрегация.
- Координатор усредняет обновления в новую общую модель. Если апдейт странный (сбой или злой умысел) — его выкидывают, чтобы не сломал результат. Это называют устойчивой агрегацией.
- Координатор сохраняет новую модель в базу версий (MLflow, ClearML, Weights & Biases) — можно сравнить прогресс между раундами и при сбое откатиться.
- Если модель не учится — координатор зовёт человека. Когда качество падает несколько раундов подряд, обучение останавливают, инженер разбирается.
Десять больниц в итоге получат общую диагностическую модель, обученную на снимках всех вместе, — и при этом ни один пациент не «утечёт» наружу. То же в ближайшие 3–5 лет повторится в банках, на заводах, в образовании — везде, где данные ценны вместе, а делиться ими нельзя. Открытыми остаются вопросы приватности без потери точности и устойчивости при тысячах узлов — каждый открывает поле для исследований.
Сергей Ермаков, старший преподаватель кафедры Инструментального и прикладного программного обеспечения Института информационных технологий МИРЭА — Российского технологического университета