Удивительная идея о том, что генеративный ИИ может лучше использовать в качестве токенов визуальные изображения текста, а не чистый текст

В сегодняшней колонке я рассматриваю довольно инновационную идею, которая ловко переворачивает традиционную конструкцию генеративного ИИ и больших языковых моделей (LLM) с ног на голову. Проще говоря, рассмотрим дерзкую идею о том, что вместо того, чтобы генеративный ИИ получал чистый текст, текст сначала фиксировался в виде изображений, а затем изображения передавались в ИИ.

Чего-чего?

Для тех, кто разбирается в технической основе программ LLM, это кажется совершенно странным и нелогичным. Возможно, вы уже кричите вслух, что это бессмысленно. Вот почему. LLM предназначен для работы с естественными языками, такими как английский, и, следовательно, широко использует текст. Текст — это способ, которым мы обычно вводим подсказки и вопросы в LLM. Решение использовать изображения текста вместо реального текста должно быть абсурдной концепцией. Кощунственно.

Придержите шляпу, потому что некоторые серьезные исследователи опробовали этот подход, и есть достаточно оснований, чтобы мы должны уделить полету фантазии хоть капельку серьезного и прилежного внимания.

Давайте поговорим об этом.

Этот анализ прорывов в области ИИ является частью моей постоянной статьи в колонке Forbes о последних достижениях в области ИИ, включая выявление и объяснение различных важных сложностей ИИ (см. ссылка здесь).

Токенизация имеет решающее значение

Суть вопроса заключается в аспектах токенизации современного генеративного искусственного интеллекта и LLM. Я рассмотрел детали токенизации на ссылка здесь. Я предоставлю краткий обзор, чтобы вы могли быстрее разобраться.

Когда вы вводите текст в AI, он преобразуется в различные числа. Эти цифры затем обрабатываются на протяжении всей остальной обработки вашего запроса. Как только ИИ получает ответ, ответ фактически имеет числовой формат и должен быть преобразован обратно в текст, чтобы пользователь мог его прочитать. ИИ преобразует числа в текст и соответствующим образом отображает ответ.

Весь этот процесс известен как токенизация. Вводимый вами текст кодируется в набор цифр. Числа называются токенами. Числа, или, скажем так, жетоны, проходят через ИИ и используются для поиска ответов на ваши вопросы. Ответ изначально имеет числовой формат токенов и его необходимо декодировать обратно в текст.

К счастью, обычный пользователь в блаженном неведении о процессе токенизации. Им не обязательно об этом знать. Эта тема представляет большой интерес для разработчиков ИИ, но мало интересна широкой публике. Часто используются всевозможные числовые уловки, чтобы попытаться максимально ускорить процесс токенизации, чтобы ИИ не задерживался во время необходимого кодирования и декодирования.

Токены – это проблема

Я упомянул, что широкая общественность обычно не знает об аспектах токенизации LLM. Это не всегда так. Любой, кто доводил ИИ до предела, вероятно, смутно осведомлен о токенах и токенизации.

Дело вот в чем.

Большинство современных LLM, таких как ChatGPT и GPT-5 от OpenAI, Anthropic Claude, Meta Llama, Google Gemini, xAI Grok и другие, несколько ограничены из-за количества токенов, которые они могут адекватно обрабатывать одновременно. Когда ChatGPT впервые появился на сцене, количество разрешенных токенов в одном разговоре было весьма ограничено.

Вы могли бы грубо обнаружить этот факт, если бы ChatGPT вдруг больше не мог вспомнить предыдущие части вашего разговора. Это произошло из-за того, что ИИ не знал, сколько активных токенов может существовать одновременно. Жетоны, использованные ранее в вашем разговоре, были немедленно выброшены.

Если вы вели длинные и сложные разговоры, эти ограничения раздражали и практически исключали любое широкое использование генеративного ИИ. Вы были ограничены относительно короткими разговорами. Та же проблема возникла, когда вы импортировали текст с помощью такого метода, как RAG (см. мое обсуждение на ссылка здесь). Текст нужно было токенизировать и еще раз сосчитать по порогу того, сколько активных токенов может обработать ИИ.

Это сводило с ума тех, кто мечтал использовать генеративный искусственный интеллект для решения более масштабных проблем.

Пределы выше, но все еще существуют

Ранние версии ChatGPT имели ограничение менее 10 000 токенов, которые могли быть активны в любой момент времени. Если вы думаете о токене как о небольшом слове, таком как «the» или «dog», это означает, что вы уперлись в стену, как только ваш разговор употребил примерно десять тысяч простых слов. В то время это было невыносимо для любого длительного или сложного использования.

В настоящее время обычная версия GPT-5 имеет окно контекста токена, содержащее около 400 000 токенов. Это считается общей емкостью, связанной как с входными, так и с выходными токенами, как общей суммы. Размеры контекстного окна могут различаться. Например, Claude имеет лимит в 200 000 токенов на некоторых своих моделях, в то время как другие расширяются до 500 000 токенов.

Дальновидный взгляд на будущее заключается в том, что не будет никаких ограничений, связанных с разрешенным количеством токенов. В ИИ ведутся новейшие работы над так называемой бесконечной или бесконечной памятью, которая позволит использовать любое количество токенов. Конечно, в практическом смысле серверной памяти может существовать только определенный объем; таким образом, оно на самом деле не бесконечно, но утверждение броское и достаточно справедливое. Мое объяснение того, как работает бесконечная память ИИ, см. ссылка здесь.

Решение проблемы токенов

Поскольку токенизация лежит в основе того, как разрабатывается и используется большинство LLM, было предпринято много усилий, чтобы попытаться оптимизировать аспекты токенизации. Цель состоит в том, чтобы каким-то образом уменьшить размер токенов, если это возможно, позволяя большему количеству токенов существовать в рамках любых ограничений памяти, имеющихся в системе.

Разработчики ИИ неоднократно пытались сжать токены. Это может оказаться большой помощью. В то время как окно токенов обычно может быть ограничено 200 000 токенов, если бы вы могли уменьшить каждый токен до половины его обычного размера, вы могли бы удвоить лимит до 400 000 токенов. Хороший.

Существует неприятная проблема, связанная со сжатием токенов. Да, часто вы можете уменьшить их размер, но при этом точность снижается. Это плохо. Возможно, это не так уж и плохо в том смысле, что они по-прежнему работоспособны и пригодны к использованию. Все зависит от того, насколько пожертвована точность.

В идеале вам нужно максимально возможное сжатие и сделать это со 100% сохранением точности. Это высокая цель. Скорее всего, вам придется сопоставить уровни сжатия с прецизионностью. Как и большинство вещей в жизни, бесплатных обедов не бывает.

Сними носки

Предположим, мы позволили себе мыслить нестандартно.

Обычный подход к LLM — принять чистый текст, закодировать его в токены и продолжить своим веселым путем. Мы почти всегда начинаем мыслить о токенизации с логического и естественного предположения, что вводимые пользователем данные будут представлять собой чистый текст. Они вводят текст с помощью клавиатуры, а текст преобразуется в токены. Это простой подход.

Подумайте, что еще мы можем сделать.

Предположим, мы рассматривали текст как изображения.

Вы уже знаете, что можно сфотографировать текст, затем оптически отсканировать его и либо сохранить в виде изображения, либо позже преобразовать в текст. Этот процесс представляет собой давнюю практику, известную как OCR (оптическое распознавание символов). OCR существует с первых дней существования компьютеров.

Обычный процесс оптического распознавания символов состоит из преобразования изображений в текст и называется преобразованием изображения в текст. Иногда вам может потребоваться сделать обратное, а именно, у вас есть текст и вы хотите преобразовать его в изображения, то есть обработку текста в изображение. Существует множество существующих программных приложений, которые с радостью выполняют преобразование изображения в текст и текст в изображение. Это старая шляпа.

Вот сумасшедшая идея о LLM и токенизации.

У нас по-прежнему есть люди, которые вводят текст, но мы берем этот текст и преобразуем его в изображение (т. е. преобразуем текст в изображение). Далее изображение текста используется кодировщиком токена. Таким образом, вместо кодирования чистого текста кодер кодирует изображения текста. Когда ИИ будет готов предоставить ответ пользователю, токены будут преобразованы из токенов в текст с использованием преобразования изображения в текст.
Бум, брось микрофон.

Осмысление сюрприза

Ого, вы можете сказать, какая польза от этой игры с изображениями?

Если преобразование изображений в токены поможет нам получить токены меньшего размера, мы сможем сжимать токены. Это, в свою очередь, означает, что мы потенциально можем иметь больше токенов в пределах ограниченной памяти. Помните, что сжатие токенов у нас на уме.

В недавно опубликованном исследовании под названием «DeepSeek-OCR: Оптическое сжатие контекстов» Хаоран Вэй, Яофэн Сунь, Юкунь Ли, arXiv21 октября 2025 г., в исследовательской работе содержались следующие утверждения (выдержки):

  • «Одно изображение, содержащее текст документа, может представлять богатую информацию, используя значительно меньше токенов, чем эквивалентный цифровой текст, что позволяет предположить, что оптическое сжатие с помощью токенов видения может обеспечить гораздо более высокую степень сжатия».
  • «Это понимание побуждает нас пересмотреть модели визуального языка (VLM) с точки зрения LLM, сосредоточив внимание на том, как видеокодеры могут повысить эффективность LLM при обработке текстовой информации, а не на базовом VQA, в котором люди преуспевают».
  • «Задачи оптического распознавания символов, как промежуточная модальность, соединяющая зрение и язык, обеспечивают идеальную испытательную площадку для этой парадигмы сжатия визуального текста, поскольку они устанавливают естественное сопоставление сжатия-декомпрессии между визуальными и текстовыми представлениями, предлагая при этом количественные показатели оценки».
  • «Наш метод обеспечивает точность декодирования OCR 96%+ при 9-10-кратном сжатии текста, ∼90% при 10-12-кратном сжатии и ∼60% при 20-кратном сжатии в тестах Fox с различными макетами документов (при этом фактическая точность еще выше, если учитывать различия в форматировании между выходными и реальными данными)».

Как отмечалось выше, экспериментальная работа, похоже, показала, что степень сжатия в 10 раз меньше может иногда быть достигнута с точностью 96%. Если бы это можно было сделать повсеместно, это означало бы, что, хотя сегодня ограничение окна токенов может составлять 400 000 токенов, этот лимит можно было бы повысить до 4 000 000 токенов, хотя и с точностью 96%.

Точность в 96% может быть терпимой или нетерпимой, в зависимости от того, для чего используется ИИ. Получить бесплатный обед невозможно, по крайней мере, пока. Степень сжатия 20x была бы еще лучше, хотя точность на уровне 60% показалась бы совершенно непривлекательной. Тем не менее, могут возникнуть обстоятельства, при которых можно будет неохотно принять 60% за 20-кратное увеличение.

Знаменитый специалист по искусственному интеллекту Андрей Карпати в целом поделился в Интернете своими мыслями об этом подходе: “Мне очень нравится новая статья DeepSeek-OCR. Это хорошая модель оптического распознавания символов (может быть, немного хуже, чем точки), и да, сбор данных и т. д., но в любом случае это не имеет значения. Более интересная часть для меня (особенно для человека с компьютерным зрением, который временно маскируется под человека, говорящего на естественном языке) заключается в том, являются ли пиксели лучшими входными данными для LLM, чем текст. Является ли текст. жетоны расточительны и просто ужас, на входе. Возможно, имеет больше смысла, чтобы все входные данные для LLM всегда были только изображениями». (источник: Twitter/X, 20 октября 2025 г.).

Мозговой штурм полезен

В ходе исследования также пытались использовать множество естественных языков. Это еще одна ценность использования изображений, а не чистого текста. Как вы знаете, существуют естественные языки, в которых используются графические символы и слова. Эти языки кажутся особенно хорошо подходящими для метода токенизации на основе изображений.

Еще один интригующий аспект заключается в том, что у нас уже есть VLM, состоящие из ИИ, который работает с визуальными изображениями, а не с текстом как таковым (т. е. моделями визуального языка). Нам не нужно изобретать велосипед, когда дело доходит до получения степени LLM. Просто позаимствуйте то, что уже работало с VLM, и приспособьтесь к использованию в LLM. Это использование всей головы и повторное использование, когда это возможно.

Идея достойна признания и дополнительного изучения. Я бы не советовал сразу ходить вокруг да около и заявлять, что всем магистрантам необходимо перейти на такой метод. Жюри все еще отсутствует. Нам нужны дополнительные исследования, чтобы увидеть, как далеко это зайдет, а также понять как положительные, так и отрицательные стороны.

Между тем, я думаю, мы можем, по крайней мере, сделать смелое заявление: «Иногда картинка действительно стоит тысячи слов».

2025-10-25 07:15:00


1761381661
#Удивительная #идея #том #что #генеративный #ИИ #может #лучше #использовать #качестве #токенов #визуальные #изображения #текста #не #чистый #текст

Читайте также

Read more:  Усиленный в лаборатории обонятельный рецептор открывает новое представление о том, как работает наше обоняние

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.