У ИИ появился частный репетитор для более точного изучения человеческих предпочтений

Концептуальная диаграмма TVKD: после обучения модели учителя набору данных о предпочтениях человека обучение продолжается путем доставки информации об учителе и набора данных в модель ученика. Фото: Корейский институт передовой науки и технологий (KAIST).

Независимо от того, сколько данных они изучают, почему модели искусственного интеллекта (ИИ) часто не отражают намерения человека? Традиционное сравнительное обучение, призванное помочь ИИ понять человеческие предпочтения, часто приводит скорее к путанице, чем к ясности. Исследовательская группа KAIST представила новое решение для обучения, которое позволяет ИИ точно изучать предпочтения человека даже при наличии ограниченных данных, назначая ему «частного репетитора».

Исследовательская группа под руководством профессора Джунмо Кима из Школы электротехники KAIST разработала TVKD (Дистиллация знаний на основе ценностей учителя), структуру обучения с подкреплением, которая значительно повышает эффективность данных и стабильность обучения, эффективно отражая при этом человеческие предпочтения. Их статья опубликовано на arXiv сервер препринтов.

Ограничения традиционного обучения ИИ

Существующие методы обучения ИИ обычно основаны на сборе огромных объемов данных сравнения предпочтений — простых структур, таких как «А лучше, чем Б». Однако этот подход требует обширных наборов данных и часто приводит к замешательству ИИ в неоднозначных ситуациях, когда различие неясно.

Чтобы решить эту проблему, исследовательская группа предложила метод, в котором «модель учителя», которая сначала глубоко поняла человеческие предпочтения, передает «модели ученика» только основную информацию. Это можно сравнить с частным репетитором, который организует и преподает сложный контент, и исследовательская группа назвала это дистилляцией предпочтений.

Как работает дистилляция предпочтений

Самая большая особенность этой технологии заключается в том, что вместо простой имитации хорошего или плохого она спроектирована так, что модель учителя изучает функцию ценности, которая численно определяет, насколько ценна каждая ситуация, а затем передает ее в модель ученика. Благодаря этому ИИ может учиться, вынося комплексные суждения о том, «почему этот выбор лучше», а не фрагментарные сравнения, даже в неоднозначных ситуациях.

Суть этой технологии двоякая. Во-первых, благодаря отражению оценочных суждений, учитывающих весь контекст, в модели ученика, стало возможным обучение, которое понимает общий поток, а не фрагментарные ответы. Во-вторых, была введена методика корректировки важности обучения в соответствии с надежностью данных о предпочтениях. Четкие данные существенно отражаются на обучении, в то время как влияние неоднозначных или зашумленных данных снижается, что позволяет ИИ стабильно учиться даже в реалистичных условиях.

Результаты и будущие последствия

В результате применения этой технологии к различным моделям ИИ и проведения экспериментов исследовательская группа показала более точную и стабильную работу, чем ранее известные методы, показавшие лучшую производительность. В частности, были зафиксированы достижения, которые стабильно превосходят существующие ведущие технологии по основным индексам оценки, таким как MT-Bench и AlpacaEval.

Профессор Джунмо Ким сказал: «На самом деле данные о предпочтениях человека не всегда являются достаточными или идеальными», и добавил: «Эта технология позволит ИИ последовательно учиться даже в таких условиях, поэтому она будет очень практичной в различных областях».

Дополнительная информация:
Минчан Квон и др. «Дистиллация предпочтений посредством обучения с подкреплением на основе ценностей», arXiv (2025). DOI: 10.48550/arxiv.2509.16965

Информация журнала:
arXiv


Цитирование: ИИ получает частного репетитора для более точного изучения человеческих предпочтений (17 декабря 2025 г.), получено 18 декабря 2025 г. с https://techxplore.com/news/2025-12-ai-private-human-accurately.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-12-17 17:52:00


1766064836
#ИИ #появился #частный #репетитор #для #более #точного #изучения #человеческих #предпочтений

Продолжение темы

Read more:  Lidl, U, Crossroads, Leclerc, чист ... около тридцати сыров, отозванных для риска загрязнения в листерии

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.