исследования 1 мин

Как ускорить приватное федеративное обучение без лишних затрат на конфиденциальность

Исследователи предложили DP-FedSOFIM — метод федеративного обучения с дифференциальной приватностью, который использует информацию о кривизне функции потерь на стороне сервера, а не клиента. Это даёт ускорение сходимости в 4-5 раз при жёстких ограничениях на приватность без дополнительных затрат памяти и коммуникации.

Федеративное обучение используется в смартфонах, медицинских устройствах и других приложениях, где данные не могут покинуть устройство. Метод позволяет обучать модели быстрее при тех же гарантиях приватности, экономя время и энергию пользователей.

Проблема: приватность против скорости

Большинство методов федеративного обучения с дифференциальной приватностью (DP-FL) работают по простой схеме: обрезать градиенты, добавить шум, агрегировать и сделать шаг оптимизации. Когда бюджет приватности жёсткий (малые значения ε), добавленный шум заглушает полезный сигнал, и обучение замедляется или застревает.

Существующие методы второго порядка (DP-FedNew, DP-FedFC) пытаются использовать информацию о кривизне функции потерь, но делают это на стороне клиентов. Это требует O(d²) памяти и коммуникации вместо O(d), где d — размерность модели, и каждый клиент передаёт полную матрицу вместо вектора градиента.

Решение: кривизна на сервере

DP-FedSOFIM оставляет клиентскую часть идентичной базовому DP-FedGD, но добавляет оценку кривизны на сервере. Сервер поддерживает экспоненциальное скользящее среднее (EMA) приватизированных агрегатов и использует его регуляризованное внешнее произведение ранга один как аппроксимацию информационной матрицы Фишера.

Благодаря формуле Шермана-Моррисона предобусловленный шаг вычисляется в замкнутой форме без явного формирования матрицы. Это похоже на вывод о наклоне местности по траектории катящегося мяча, а не на полную съёмку холма на каждом шаге.

Результаты

Поскольку все серверные вычисления — детерминированные функции уже приватизированного агрегата, DP-FedSOFIM получает те же гарантии (ε, δ)-дифференциальной приватности, что и DP-FedGD, благодаря принципу постобработки. При этом требования к памяти остаются O(d), а не O(d²).

На CIFAR-10/ResNet при ε=5 преимущество на 10-м раунде достигает +20.3 процентных пункта, что соответствует ускорению в 4-5 раз для достижения 95% финальной точности DP-FedGD. Накладные расходы на предобуславливание — менее 2% времени на раунд против ~6x для DP-SCAFFOLD.

При очень жёстких бюджетах (ε=0.5) шум доминирует над оценкой кривизны, и преимущество исчезает, но на анизотропных ландшафтах (PathMNIST) метод работает при любом бюджете.

Ключевые выводы

  • Адаптация к кривизне в приватном федеративном обучении эффективнее как серверная постобработка, а не клиентская оценка
  • Ранга один достаточно для захвата полезного сигнала кривизны на анизотропных ландшафтах потерь
  • Принцип постобработки в дифференциальной приватности недоиспользуется в федеративном обучении
  • При экстремально малых бюджетах приватности (ε≤0.5) шум доминирует над любой оценкой кривизны
  • Ускорение наиболее выражено на ранних этапах обучения, адаптивные базовые методы догоняют к 70-му раунду
федеративное обучениедифференциальная приватностьоптимизация второго порядкаконфиденциальностьраспределённые вычисления

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Это хороший пример того, как теоретическая находка может дать практический выигрыш. Авторы заметили, что в федеративном обучении все пытаются улучшить оценку градиентов на стороне клиентов, хотя принцип постобработки в дифференциальной приватности позволяет делать что угодно на сервере бесплатно. Перенесли оценку кривизны туда — и получили ускорение без дополнительных затрат приватности или коммуникации.

Однако стоит помнить ограничения: при очень жёстких бюджетах приватности (ε<1) шум заглушает всё, и преимущества нет. Плюс это академическое исследование на стандартных бенчмарках — насколько это сработает в продакшене Google Keyboard или Apple Health, покажет время. Но направление верное: искать не «как лучше защитить данные», а «как лучше использовать уже защищённые данные».

Ещё по теме

Комментарии