Premium ReportIndustry Insights
Новая архитектура HBF: как High Bandwidth Flash меняет правила игры в обслуживании LLM
10/3/2026
1 VIEWS
Совместная исследовательская работа UC Berkeley и FuriosaAI, посвященная концепции High Bandwidth Flash (HBF), представляет собой критически важный сдвиг в парадигме аппаратного обеспечения для искусственного интеллекта. В условиях, когда современные LLM требуют гигантских объемов памяти для хранения весов моделей и KV-кэшей, традиционные иерархии памяти на базе DRAM и HBM (High Bandwidth Memory) начинают демонстрировать пределы своей масштабируемости из-за высокой стоимости и ограничений по энергопотреблению.
Суть HBF заключается в использовании высокопроизводительной флэш-памяти для разгрузки иерархии памяти в задачах инференса LLM. В то время как классические архитектуры полагаются исключительно на дорогостоящие HBM, HBF позволяет эффективно расширять емкость памяти, практически не жертвуя скоростью отклика в агентных рабочих нагрузках. Это решение снимает «узкое место» пропускной способности, которое сегодня ограничивает длину контекста и плотность запросов на один GPU/NPU.
Для полупроводниковой индустрии внедрение HBF влечет за собой фундаментальные изменения в цепочках поставок. Во-первых, это создает новый сегмент рынка для специализированных контроллеров NAND и высокоскоростных интерфейсов, оптимизированных для AI-стека. Производители флэш-памяти получают уникальную возможность выйти из ниши систем хранения данных в сегмент вычислительных ускорителей, что существенно повышает маржинальность их продукции. Для вендоров GPU, таких как NVIDIA или AMD, это означает возможность создания более гибких систем с «многоярусной» памятью, где флэш-память дополняет HBM, обеспечивая экономическую эффективность при работе с моделями гигантского размера.
С точки зрения будущего развития, технология HBF может стать катализатором демократизации LLM. Снижение стоимости владения инфраструктурой для обслуживания моделей позволит компаниям второго и третьего эшелонов запускать сложные агентные системы локально, без критической зависимости от сверхдорогих кластеров H100. Мы прогнозируем, что в ближайшие два-три года интеграция HBF станет стандартом де-факто для чипов, ориентированных на Edge AI и облачные вычисления, что окончательно изменит ландшафт рынка памяти, сделав упор не только на чистую скорость, но и на интеллектуальное управление данными внутри вычислительного узла.
