Без данных ИИ не смог бы существовать, и ИИ не может стать лучше без значительных изменений в том, как данные хранятся и используются в сценариях ИИ. Традиционные системы хранения данных просто хранят необработанные данные, но для загрузки слов ИИ требуются системы, которые могут превращать необработанную информацию в знания. Лидером изменений в том, что мы считаем хранилищем, является компания Huawei, помогающая предприятиям использовать информацию в новом будущем хранения данных.
Появление искусственного интеллекта привело к появлению четырех ключевых областей, к которым необходимо адаптировать хранилище: корпус ИИ, обучение ИИ, логический вывод ИИ и агентный ИИ. Каждая из этих областей имеет свои собственные технические проблемы, которые требуют уникальных и инновационных решений.
Корпус искусственного интеллекта: создание интеллектуальных озер данных
Основой любой модели ИИ являются данные, на которых она обучается. Большинство крупных организаций борются с фрагментированной, разрозненной информацией. Архитектура озера данных на базе искусственного интеллекта Huawei обеспечивает эффективное агрегирование огромных массивов данных с высокой плотностью хранения и управлением мультимодальным объединением данных.
Несмотря на то, что большинство предприятий отказываются от 97% своих данных, ключевой момент заключается не только в хранении большего количества данных, но и в том, чтобы сделать существующие данные более доступными, обнаруживаемыми и пригодными для обучения. Архитектура озера данных искусственного интеллекта Huawei превращает изолированные острова в хранилища данных, позволяя компаниям агрегировать огромные объемы данных. Технология DME Omni-Dataverse помогает сделать данные более доступными и облегчает обмен данными между отделами.
Обучение искусственному интеллекту: минимизация времени простоя, максимизация эффективности
При обучении крупномасштабного ИИ тренировочные прогоны могут длиться в среднем до 2,6 дней, прежде чем сбои оборудования, техническое обслуживание или другие перерывы приведут к остановке. В этом случае система должна запуститься с контрольной точки. Эти контрольные точки включают в себя огромные объемы данных, чтение и запись которых в систему требуют много времени.
Это означает, что пока хранилище выполняет свою работу, графические процессоры, которые часто являются самой дорогой частью системы, идеально сидят в ожидании задач. Система хранения OceanStor A от Huawei может сократить время, необходимое для сохранения и перезапуска с контрольных точек, сокращая время, необходимое для обучения ИИ и полного использования всей вычислительной системы.
Реальный пример – iFLYTEK. Система хранения данных OceanStor A от Huawei сократила время восстановления контрольной точки до одной минуты, а загрузка графического процессора подскочила с 30% до 60%.
Вывод искусственного интеллекта: революция памяти
Когда дело доходит до сценариев использования данных и искусственного интеллекта, Huawei заявляет, что отрасль сейчас переходит от требований к обучению искусственному интеллекту к большему количеству логических выводов с использованием искусственного интеллекта. На мероприятии Huawei Connect присутствовал доктор Питер Чжоу, вице-президент Huawei и президент линейки продуктов для хранения данных Huawei, который выступил с речью, в которой говорилось: «Спрос на логические выводы превысил спрос на обучение. Что касается скорости вывода, основные крупные модели за рубежом работают со скоростью 200 токенов в секунду (с задержкой 5 мс), в то время как китайские большие модели отстают в 10 раз, при этом задержка вывода превышает 1 минуту, что срочно требует оптимизация».
Именно здесь технология Unified Cache Manager (UCM) Huawei становится решающей. Технология UCM позволяет избежать избыточных вычислений за счет ссылки на исторические данные, очистки избыточной информации KV-кэша для сокращения длины текста вывода, а также прогнозирования входных данных вывода и автоматического сопоставления оптимальных результатов за счет оптимизации длины последовательности. Это позволяет продолжить точку останова, что решает проблемы, когда задачи необходимо перезапустить при масштабировании ресурсов предварительного заполнения/декодирования.
«Во время вывода лучше хранить токены в кеше. В противном случае вам придется выполнять вычисления повторно», — сказал Юань Юань, президент домена распределенного хранения данных Huawei. «Если у вас нет кеша в хранилище выводов, каждый раз, когда вы задаете вопросы, система производит вычисления с нуля, тратя вычислительные ресурсы».
UCM — это первое в отрасли комплексное, полномасштабное и развиваемое систематическое решение. UCM создает решение «трехуровневого взаимодействия структуры вывода, вычислительной мощности и хранилища» с помощью ряда алгоритмов ускорения на основе сценариев, наборов и открытых сторонних библиотек.
Это особенно важно с появлением агентного ИИ. Использование ИИ для выполнения задач требует значительно большей скорости, чем когда дело касается обучения. Необходимо обрабатывать не только кратковременную и долговременную память, но и знания, специфичные для предметной области, и не только аппаратное обеспечение уменьшает это узкое место.
Будущая платформа данных ИИ должна поддерживать многоуровневое унифицированное кэширование, которое позволит использовать мультимодальные базы знаний и базы памяти для повышения интеллекта агентов ИИ. Достижения в этой технологии имеют решающее значение для бизнеса, поскольку эпоха искусственного интеллекта требует лучшего управления корпусом, обучения и ускорения вывода для агентных систем искусственного интеллекта, которые становятся все более важными для бизнеса.
В эпоху агентного искусственного интеллекта системы хранения должны быть чем-то большим, чем просто хранилищами данных, и стать более вычислительной и интеллектуальной частью системы, которая может хранить и совместно использовать знания, память и контекст.
Несмотря на огромный объем уже хранимой информации, объемы хранения данных по-прежнему растут быстрыми темпами, и ожидается, что они будут расти еще больше. При нынешних темпах предприятия хранят менее 3% своих данных и делятся ими менее 25%. Большая часть данных хранится в изолированных хранилищах. «Мы считаем, что находимся на поворотном этапе благодаря ИИ», — объясняет Юань Юань. «До появления ИИ от огромных объемов данных отказывались, потому что не было хорошего подхода к их обработке. Но ИИ дает нам хороший подход к увеличению ценности данных».
Почему флэш-хранилище важно для ИИ
Традиционное хранилище не может справиться с проблемами низкой задержки, высокого уровня операций ввода-вывода в секунду и доступности кластера, когда речь идет о требованиях ИИ. Эти ограничения приводят к потере 97% данных в источнике и задержкам вывода, превышающим одну минуту.
Жесткие диски традиционно использовались для хранения менее часто используемых «холодных данных» и могут передавать примерно 100 мегабайт в секунду, что, хотя и впечатляет, может быть достигнуто только при последовательном чтении больших объемов данных. Рабочие нагрузки искусственного интеллекта требуют различных типов задач, требующих гораздо более высоких скоростей произвольного доступа, при которых твердотельные накопители могут достигать скорости 15 гигабайт в секунду. Что касается количества операций ввода-вывода в секунду, энергопотребления, размера и веса, твердотельные накопители предлагают примерно в 10 раз преимущество по сравнению с традиционными накопителями. Проблема в том, что раньше скорость SSD стоила дорого. Однако теперь ценность скорости передачи данных растет, а благодаря снижению цены на технологию хранения данных Huawei, разрыв в цене между жесткими дисками и твердотельными накопителями сокращается.
«Уровень использования графического процессора во время обучения у многих клиентов составляет примерно 50%», — добавил Юань Юань. «Это означает, что половину времени дорогие графические карты простаивают, ожидая данных из хранилища». Это время простоя представляет собой значительную трату вычислительных ресурсов.
Решение Huawei состоит в том, чтобы опираться на стратегию хранения данных на основе флэш-накопителей, которая может устранить эти узкие места и способствовать развитию бизнеса. OceanStor Pacific 9926 имеет в 8 раз большую плотность емкости, чем жесткий диск, что снижает стоимость владения на 54 % и сокращает рабочие нагрузки на логические выводы с минут до секунд.
Подход Huawei выходит за рамки простого обновления оборудования. Их системы хранения данных серии OceanStor A обеспечивают пропускную способность 500 гигабайт в секунду и более 10 миллионов операций ввода-вывода в секунду и специально разработаны для рабочих нагрузок по обучению искусственного интеллекта. Возможно, что еще более важно, они достигли лидирующего в отрасли уровня энергоэффективности — 0,25 Вт на терабайт — примерно вдвое меньше энергопотребления традиционных систем хранения данных.
Полностью флэш-подход
В современных системах хранения данных HDD и SDD счастливо сосуществуют бок о бок. Каждый играет в свою пользу. Жесткие диски дешевле для хранения больших объемов данных и могут идеально работать без ухудшения качества в течение длительного времени, но они медленнее, чем твердотельные накопители. Поэтому компании будут хранить редко используемые холодные данные на жестких дисках, а горячие данные, которые необходимо использовать регулярно, — на твердотельных накопителях, обеспечивая баланс между затратами и производительностью.
«В эпоху искусственного интеллекта существует популярная концепция, называемая «теплыми» данными — не горячими, не холодными, а теплыми», — объяснил Юань Юань. «Это означает, что когда вам нужны данные, они нужны вам немедленно». Юань Юань также добавил, что жесткие диски больше не считаются более стабильным вариантом. «У технологии SSD были проблемы с выходом из строя ячеек памяти. Но за пять лет в чипах SSD, контроллерах и секторах памяти было реализовано множество новых технологий. Теперь они достаточно надежны, чтобы без проблем прослужить 5-10 лет».
Для компаний также не проблема переносить данные с жестких дисков на твердотельные накопители, поскольку интерфейсы и модели доступа остаются прежними. Независимо от того, получаете ли вы доступ к файлам через блочное хранилище, протокол между вычислениями и хранилищем не меняется — вы просто меняете медиа-часть. Это как переносить с одной единицы оборудования на SSD.
Бездонные ведра
«Твердотельные накопители текущего поколения работают со скоростью около 15 ГБ/с. Следующее поколение будет намного быстрее — потенциально утроив производительность», — объясняет Юань Юань. «Мы не видим немедленных ограничений, поскольку мы можем продолжать масштабирование разными способами».
В Huawei полагают, что они еще далеки от достижения каких-либо жестких ограничений на производительность твердотельных накопителей, и, поскольку 20-30% доходов Huawei идут на исследования и разработки, если бы существовало ограничение на производительность твердотельных накопителей, Huawei будет готова предложить следующие решения для хранения данных.
«Эти расследования необходимы, потому что технологии развиваются очень быстро, особенно в связи с требованиями ИИ», — добавил Юань Юань.
Это хорошо, поскольку все прогнозы показывают, что требуемый объем хранилища будет только расти по мере того, как ИИ все больше и больше внедряется в нашу повседневную жизнь.
Глобальное признание и рост
Компания Huawei возглавила рейтинг систем хранения данных Gartner с новыми решениями для хранения данных в эпоху искусственного интеллекта. Стратегия All-Flash и решения для хранения данных Huawei, предназначенные для решения проблем традиционных жестких дисков в эпоху искусственного интеллекта, позволили Huawei занять место лидера в Магическом квадранте для предприятий.
Huawei также заняла первое место в отчете Gartner «Выбор клиентов» и «Критические возможности», что свидетельствует о доверии и лидерстве в сфере услуг, качества и функций, когда дело касается систем хранения данных.
Huawei покрыла Джеймсу расходы на перелет и проживание в рамках платной кампании.
2025-10-09 15:55:00
1760026006
#Превращение #данных #знания #как #Huawei #модернизирует #хранилище #для #эпохи #искусственного #интеллекта
По теме

