Категории Железо

Intel показала ускоритель Crescent Island для ИИ с 480 ГБ LPDDR5X

Intel показала ускоритель Crescent Island для ИИ с 480 ГБ LPDDR5X

Intel рассказала на симпозиуме Hot Chips о подробностях ускорителя Crescent Island на архитектуре Xe3P. Компания делает ставку не на максимальную мощность и HBM-память, а на формат с меньшим энергопотреблением для инференса в существующих дата-центрах.

Crescent Island выполнен в виде PCIe-карты с воздушным охлаждением и заявленным энергопотреблением 350 Вт. В Intel также называют объём встроенной памяти до 480 ГБ LPDDR5X, что позволяет обходиться без экзотических схем питания и охлаждения.

По словам Intel, на Hot Chips компания углубилась в архитектуру чипа сильнее, чем в прошлых раскрытиях. Внутри Crescent Island используются четыре блока Xe3P, каждый из которых включает по восемь Xe Core, а суммарно это даёт 32 ядра Xe Core, 256 Xe Vector Engines и 256 XMX-ускорителей. Ранее Intel готовила iGPU на 12 ядер Xe3P для Nova Lake-S.

  • 32 Xe Core в составе четырёх Xe3P-блоков.
  • До 480 ГБ LPDDR5X памяти.
  • 350 Вт и воздушное охлаждение.
  • 32 МБ общего кэша L2.

Ускоритель Crescent Island и архитектура Xe3P

Intel заявляет, что Xe3P усиливает локальные хранилища данных по сравнению с Battlemage и Xe2. На каждый Xe Core приходится 1 МБ общего регистра файла, тогда как у Battlemage и Xe2 этот объём составлял 512 КБ, а объём L1-кэша или shared local memory вырос до 512 КБ на Xe Core.

У Xe3P также есть 32 МБ разделяемого L2-кэша. Эти кэши компания увязывает с более крупными матричными ускорителями, которые и должны тянуть основную нагрузку в ИИ-задачах.

Ещё одно изменение касается XMX-движков. Intel говорит, что в Xe3P они стали 16-уровневыми по глубине systolic-дизайна, тогда как у Xe2 и Xe3 использовалась четырёхуровневая схема. По замыслу это позволяет обрабатывать матрицы более крупными блоками за один проход.

Читайте также:

Компания также подчёркивает широкий набор поддерживаемых типов данных. Среди них есть FP4-форматы с microscaling, а также полный темп для FP64 через 64 блока FP64 FMA на каждый Xe Core. Intel отдельно отмечает, что такое сочетание делает Crescent Island полезным и как ИИ-ускоритель, и как часть систем для высокопроизводительных вычислений.

Сценарии применения

Intel прямо связывает Crescent Island с моделями mixture-of-experts и speculative decoding. В компании поясняют, что такие схемы используют лёгкий механизм для подготовки черновиков будущих токенов, которые основная модель потом принимает или отклоняет.

Crescent Island работает на LPDDR5X, а значит, не может рассчитывать на ту же пропускную способность, что ускорители на HBM, поэтому дополнительные вычислительные механизмы для него особенно важны.

Intel называет этот чип оптимизированным для compute-bound задач, прежде всего для prefill, то есть обработки запроса и построения KV cache. Компания говорит и о высокой эффективности по FLOPS на ватт, а также о сценариях с гетерогенным развёртыванием.

В Crescent Island есть и медиа-блок с четырьмя кодерами и декодерами, чтобы обслуживать видеопотоки для мультимодальных ИИ-моделей. При этом графические функции вроде RT-ядер в чипе отсутствуют: Intel убрала их, чтобы освободить площадь кристалла под вычисления.

Для дата-центрового продукта Intel добавила набор функций надёжности и обслуживания, включая ECC, защиту паритетом по всему кристаллу и дополнительные механизмы контроля над памятью. Компания обещает Crescent Island во второй половине 2026 года, но пока не раскрывает ни теоретическую производительность в FLOPS, ни показатели пропускной способности памяти.

Источник: Tomshardware