Представьте, что вы меняете дизайн своего жизненного пространства. Вы можете нанять дизайнера интерьера за несколько тысяч долларов. Или вы можете попросить сделать это инструмент искусственного интеллекта, такой как ChatGPT.
Но может ли ИИ на самом деле выполнить эту работу? Посмотрите, что произошло в исследовании, в котором сравнивалось, насколько хорошо лучшие системы искусственного интеллекта и люди справлялись с сотнями реальных рабочих заданий, включая создание цифровой версии этого нарисованного от руки плана этажа.
Человек представил профессионально выглядящий план этажа.
Самая эффективная система искусственного интеллекта также создала правдоподобный план этажа, хотя и с гораздо меньшим количеством деталей.
Но версия ИИ совершенно неверна.
Неудачный план здания иллюстрирует разрыв отношений через три года после выпуска ChatGPT, который имеет последствия для всей экономики.
ИИ может выполнять множество впечатляющих задач, связанных с компьютерным кодом, документами или изображениями. Это привело к предсказаниям о том, что многие виды человеческой работы вскоре смогут выполняться только компьютерами. Университет Бентли и Гэллап найденный Согласно опросу, проведенному в прошлом году, около трех четвертей американцев ожидают, что ИИ сократит количество рабочих мест в США в течение следующего десятилетия.
Но экономические данные показывают технология в значительной степени не заменила рабочих.
Чтобы понять, какую работу ИИ может выполнять самостоятельно сегодня, исследователи собрал сотни примеров проектов, размещенных на платформах фрилансеров, за выполнение которых людям платили деньги. В их число входили такие задачи, как создание 3D-анимации продуктов, расшифровка музыки, кодирование веб-видеоигр и форматирование исследовательских работ для публикации.
Затем исследовательская группа передала каждую задачу системам искусственного интеллекта, таким как ChatGPT OpenAI, Gemini Google и Claude Anthropic.
По данным исследовательской группы Scale AI, стартапа, который предоставляет данные разработчикам ИИ, и Центра безопасности ИИ, некоммерческой организации, занимающейся пониманием рисков, связанных с ИИ, наиболее эффективная система ИИ успешно завершила только 2,5 процента проектов.
«Нынешние модели далеки от возможности автоматизировать реальные рабочие места в экономике», — сказал Джейсон Хаусенлой, один из исследователей Индекс удаленного труда изучать. По его словам, они создали индекс, чтобы предоставить политикам четкую информацию о возможностях систем искусственного интеллекта.
Результаты индекса удаленного труда были опубликованы в октябре на основе тестов лучших систем искусственного интеллекта, доступных на тот момент. Исследователи планируют обновить результаты по мере выхода новых моделей. Манус и xAI отказались отвечать на вопросы об исследовании. Anthropic, Google и OpenAI не ответили на запросы о комментариях. The Washington Post заключила контент-партнерство с OpenAI.
Еще одно рабочее задание в рамках исследования заключалось в создании интерактивной информационной панели, визуализирующей данные из Всемирный доклад о счастье. На первый взгляд ИИ результаты выглядят адекватными. Но более внимательное изучение выявляет ошибки, такие как страны, по необъяснимым причинам пропускающие данные, дублирующийся текст и легенды, в которых используются неправильные цвета или вообще нет цветов.
Проект: Создание информационной панели данных
Системам искусственного интеллекта и человеку была предоставлена электронная таблица и предложено создать «интуитивную, автономную интерактивную панель управления, которая позволяет посетителям понять, почему некоторые страны получают более высокие баллы, чем другие, в Докладе о мировом счастье».



Источник: Индекс удаленного труда.
Исследование Remote Labor Index — одно из первых, в котором измеряется эффективность ИИ при выполнении реальных рабочих заданий без посторонней помощи, вместо этого тестируя технологию на искусственных примерах задач. Результаты, показывающие, что системы искусственного интеллекта не оправдывают ожиданий, бросают вызов прогнозам о том, что технология вскоре заменит значительную часть рабочей силы.
Если бы системы искусственного интеллекта могли выполнять удаленные рабочие задания автономно, компании, использующие подрядчиков-людей, могли бы вместо этого отправлять эту работу чат-боту. Это означало бы огромную экономию средств для компаний и отсутствие работы для подрядчиков. Исследование показывает, что этот сценарий далек от реальности, по крайней мере, на данный момент.
Другой исследования оценили влияние ИИ на рынок труда сравнивая индивидуальные навыки технология может сопоставляться с навыками, используемыми в различных профессиях, часто делая вывод, что значительная часть человеческого труда заменима. Но тот факт, что система ИИ может анализировать финансовые данные и писать отчеты, не означает, что она может выполнять работу экономиста или банкира.
Системы искусственного интеллекта потерпели неудачу почти в половине проектов «Индекса удаленного труда», выполнив работу низкого качества, а более трети оставили незавершенными. Исследователи обнаружили, что почти каждый пятый имел базовые технические проблемы, такие как создание поврежденных файлов.
«Многие неудачи были довольно прозаическими», — сказал Хаузенлой. По его словам, многие из них возникли из-за двух основных ограничений сегодняшних систем искусственного интеллекта. Во-первых, у них нет долговременной памяти, поэтому они не могут учиться на предыдущих ошибках или запоминать отзывы в течение дней и недель. Во-вторых, у них возникают проблемы с визуальным пониманием, например, с графическим дизайном или с тем, как объекты будут выглядеть, если их повернуть.
Эта неудача очевидна в проекте, который запросил рекламные материалы для технологического продукта. Он включал в себя фотографирование наушников, создание 3D-модели и коротких видеороликов, демонстрирующих их дизайн. Ни одна система искусственного интеллекта не дала приемлемой работы. GPT-5 от OpenAI и Sonnet от Anthropic создавали плохие 3D-модели. Манус вообще не создавал 3D-модель, в результате чего наушники меняют внешний вид в зависимости от клипа.
Проект: Создание 3D-роликов для нового продукта
Системам искусственного интеллекта и человеку были предоставлены изображения наушников и предложено создать «высококачественные 3D-демонстрационные видеоролики продукта», демонстрирующие ключевые функции продукта.
Источник: Индекс удаленного труда.
Грэм Нойбиг, профессор Университета Карнеги-Меллона кто исследовал Как работают системы искусственного интеллекта, говорят, что одна из причин, по которой они могут потерпеть неудачу в реальных рабочих проектах, заключается в том, что они не используют те же инструменты, которые использовал бы человек-эксперт.
Например, человек, создающий визуализацию продукта, будет использовать программное обеспечение для 3D-моделирования с визуальным интерфейсом. Но чат-бот, которого просят создать 3D-модель, обычно пытается сгенерировать изображения объекта путем написания кода. Нойбиг сказал, что это отражает то, чему такие системы, как ChatGPT, обучены лучше всего, например, тексту и программированию. И это показывает практическое ограничение современных инструментов искусственного интеллекта: им сложно управлять визуальным программным обеспечением, разработанным для людей.
По его словам, модели искусственного интеллекта хорошо генерируют код, но оценить, насколько конечный результат соответствует исходному запросу, сложно. «Код прав или нет, но визуальный дизайн очень субъективен», — сказал Нойбиг.
Системы искусственного интеллекта показали лучшие результаты в решении задачи исследования, связанной с созданием веб-видеоигры. В лучшую версию, созданную без участия человека, можно играть — впечатляющий подвиг. Но система ИИ проигнорировала указание о том, что в игре есть назревающая тема.
Проект: Создать веб-игру.
Системам искусственного интеллекта и человеку было дано подробное описание игры, которую нужно было построить. «Игроки будут стремиться объединять объекты и набирать как можно больше очков, прежде чем коробка заполнится».
Примечание. Код игры был отредактирован, чтобы удалить звук для встраивания в эту статью.
Источник: Индекс удаленного труда.
Нужны ли системам искусственного интеллекта незначительные изменения или фундаментальные прорывы, чтобы успешно выполнять реальную работу, — это «ключевой вопрос в области искусственного интеллекта на данный момент», — сказал Хаузенлой.
Хотя все системы искусственного интеллекта провалили большинство проектов «Индекса удаленного труда», новые модели показали себя лучше. Недавно команда протестировала Google Gemini 3 Pro, выпущенный в ноябре. Он выполнил 1,3 процента задач по сравнению с предыдущей версией компании, преодолевавшей 0,8 процента. «Линии тренда есть», — сказал Хаузенлой.
ИИ все еще может разрушить рынок труда, не заменив полностью отдельных работников. Компании могут почувствовать, что им нужно меньше сотрудников, если каждый из них сможет делать больше с помощью чат-бота. Но если тенденция к большей автономии, которую наблюдает Хаузенлой, сохранится, экономика труда может стать ужасной для многих людей. Человек сделал видеоигру за 1485 долларов. Исследователи попросили Sonnet сделать это менее чем за 30 долларов.
2026-01-08 10:00:00
1767906286
#Анализ #Может #ли #ИИ #выполнять #вашу #работу #Посмотрите #результаты #сотен #тестов
Ещё по этой теме
