Почему Intel Z890 и Arrow Lake — плохая идея для мультигпу-систем
Пользователь на Reddit протестировал Intel Core Ultra 270K с Asus Z890 Apex для двухгпушной AI-системы и обнаружил критическую проблему: PCIe P2P между GPU не работает корректно из-за аппаратных ограничений Arrow Lake. Bandwidth падает вдвое, а при включении патченых драйверов модели выдают мусор вместо текста. Nvidia, похоже, сознательно блокирует P2P на потребительских Intel-платформах.
Критично для тех, кто собирает домашние AI-серверы с несколькими GPU: потребительские Intel-платформы физически не поддерживают нормальную работу распределённого инференса. Можно потратить деньги впустую или получить нерабочую систему.
Потребительские Intel-платформы не годятся для мультигпу AI
Пользователь Reddit поделился результатами тестирования Intel Core Ultra 270K на материнской плате Asus Z890 Apex с двумя RTX A6000 для AI-инференса. Вывод категоричный: не используйте Intel Z890 и Arrow Lake для систем с несколькими GPU.
Суть проблемы
Хотя процессоры предоставляют 24 линии PCIe 5.0 с бифуркацией 8x8x, PCIe Peer-to-Peer (P2P) между видеокартами не работает корректно. Это критично для AI-задач, где GPU должны эффективно обмениваться данными.
Тесты показали: - Bandwidth между GPU падает с ~675 GB/s до ~11 GB/s при межкарточном обмене - Даже с патченым драйвером от aikitoria/open-gpu-kernel-modules пропускная способность остаётся вдвое ниже нормы - При запуске VLLM с tensor parallel через 2 GPU модель генерирует чистый мусор («!!!!!!!!!!!!!!!!!!!!») вместо текста
Почему это происходит
В GitHub Issues nvidia/open-gpu-kernel-modules описана проблема с передачей пакетов данных через PCIe root complex процессоров Arrow Lake. Nvidia, похоже, сознательно блокирует PCIe P2P на потребительских Intel-платформах — даже RTX A6000, которые должны поддерживать P2P из коробки, требуют патченых драйверов.
Проблема не в отсутствии ReBAR (GPU корректно показывают BAR размером 64GB), не в настройках BIOS и IOMMU — это фундаментальное ограничение чипсета/прошивки.
Что использовать вместо
Автор теста использует серверы на базе AMD Epyc, где подобных проблем нет. Для мультигпу-систем под AI рекомендуются: - Серверные платформы AMD (Epyc) - Intel Xeon (не потребительские чипсеты) - Специализированные решения с корректной поддержкой P2P
Вывод: экономия на потребительской платформе Intel обернётся нерабочей системой для распределённых AI-вычислений.
Ключевые выводы
- PCIe P2P на Intel Z890/Arrow Lake не работает для AI: bandwidth падает в ~60 раз (675→11 GB/s)
- Nvidia блокирует P2P на потребительских Intel-платформах программно, зная о проблеме
- Даже с патченым драйвером модели генерируют мусор при tensor parallelism через 2+ GPU
- Для мультигпу AI-систем нужны серверные платформы (AMD Epyc, Intel Xeon), не десктопные чипсеты
- Проблема аппаратная (чипсет/firmware Arrow Lake), не решается настройками ReBAR/IOMMU
Автор: Юлия Тарасова · Источник: reddit.com
**Это важный технический нюанс, который может стоить дорого.** Когда собираешь систему с двумя-тремя GPU для локального запуска больших моделей, легко соблазниться потребительской платформой типа Z890 — вроде и PCIe 5.0, и линий достаточно. Но дьявол в деталях: без корректного PCIe P2P видеокарты не могут эффективно обмениваться данными напрямую, а Intel Arrow Lake эту функцию ломает на аппаратном уровне.
Что любопытно — Nvidia явно в курсе и **программно блокирует P2P** даже на профессиональных RTX A6000 при обнаружении потребительского Intel-чипсета. Даже если обойти блокировку патченым драйвером, толку ноль: bandwidth проседает в десятки раз, а модели выдают откровенную дичь. Для серьёзных AI-нагрузок путь один — серверные платформы вроде AMD Epyc или Intel Xeon. Потребительское железо Intel для мультигпу — деньги на ветер.
Комментарии