Оценка реальной производительности ИИ-Samsung Global Newsroom

Запатентованное эталон поддерживает многоязычные сценарии производительности, обращаясь к пробелам в существующих тестах ИИ

Samsung Electronics Today представила TrueBench (заслуживающий доверия реальный этаж оценки использования), проприетентный эталон, разработанный Samsung Research для оценки производительности ИИ.

TrueBench предоставляет комплексный набор метрик для измерения того, как крупные языковые модели (LLMS) работают в реальных приложениях производительности на рабочем месте. Чтобы обеспечить реалистичную оценку, он включает в себя различные сценарии диалога и многоязычные условия.

Опираясь на собственное использование ИИ Samsung для производительности, TrueBench оценивает широко используемые предприятия, такие как генерация контента, анализ данных, суммирование и перевод-в 10 категориях и 46 подкатегориях. Трингум обеспечивает надежную оценку с помощью автоматической оценки с AI, основанной на критериях, которые совместно спроектированы и уточняются как людьми, так и искусственным интеллектом.

«Samsung Research приносит глубокий опыт и конкурентное преимущество благодаря своему реальному опыту ИИ»,-сказал Пол (KyungWhoon) Cheun, технический директор DX Division в Samsung Electronics и глава Samsung Research. «Мы ожидаем, что TrueBench установит стандарты оценки продуктивности и укрепит технологическое руководство Samsung».

Недавно, поскольку компании принимают ИИ для задач, возникает растущий спрос на измерение производительности LLMS. Тем не менее, существующие критерии в основном измеряют общую производительность, в основном являются англоязычными и ограничиваются однократными структурами вопроса. Это ограничивает их способность отражать реальную рабочую среду.

Для решения этих ограничений TrueBench состоит из 2485 тестовых наборов по 10 категориям и 12 языкам1 -В то же время поддерживает кросс-лингвистические сценарии. Тестовые наборы изучают, что могут на самом деле решить модели ИИ, и Samsung Research Applied Test Sets в диапазоне от 8 символов до более чем 20 000 символов, отражающих задачи от простых запросов до длительного суммирования документов.

Read more:  Samsung представляет кампанию «SmartThings», встречает AI Home, в преддверии IFA 2025 - Samsung Global Newsroom

Чтобы оценить производительность моделей ИИ, важно иметь четкие критерии для оценки того, правильны ли ответы ИИ. В реальных ситуациях не все намерения пользователя могут быть явно указаны в инструкциях. TrueBench предназначен для обеспечения реалистичной оценки, рассматривая не только точность ответов, но и подробные условия, которые отвечают неявным потребностям пользователей.

Samsung Research подтвердила элементы оценки посредством сотрудничества между людьми и ИИ. Во -первых, человеческие аннотаторы создают критерии оценки, а затем ИИ рассматривает его, чтобы проверить ошибки, противоречия или ненужные ограничения. После этого человеческие аннотаторы снова уточняют критерии, повторяя этот процесс, чтобы применять все более точные стандарты оценки. Основываясь на этих перекрестных критериях, проводится автоматическая оценка моделей искусственного интеллекта, минимизирует субъективную предвзятость и обеспечивает согласованность. Кроме того, для каждого теста все условия должны быть удовлетворены для прохождения модели. Это обеспечивает более подробную и точную оценку по задачам.

Образцы данных и таблицы данных TrueBench доступны на глобальной платформе с открытым исходным кодом, которая позволяет пользователям сравнивать максимум пять моделей и с первого взгляда на всеобъемлющие сравнения производительности модели искусственного интеллекта. Кроме того, также опубликованы данные о средней длине результатов ответа, что позволяет одновременно сравнить как производительность, так и эффективность. Подробную информацию можно найти на странице обнимающего лица TrueBench на https://huggingface.co/spaces/samsungresearch/truebenchПолем

1 Китайский, английский, французский, немецкий, итальянский, японский, корейский, польский, португальский, русский, испанский и вьетнамский

2025-09-25 08:00:00


1758776972
#Оценка #реальной #производительности #ИИSamsung #Global #Newsroom

Ещё по этой теме

Read more:  Эль-Ниньо было связано с голодом в Европе в период раннего Нового времени.

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.