LATAM-GPT: Free, с открытым исходным кодом и совместным искусственным интеллектом Латинской Америки

Latam-GPT-это новый Большая языковая модель разрабатывается в Латинской Америке и для Латинской Америки. Проект, возглавляемый некоммерческим чилийским национальным центром искусственного интеллекта (Cenia), направлен на то, чтобы помочь региону достичь технологической независимости путем разработки модели ИИ с открытым исходным кодом, обученной латиноамериканским языкам и контекстам.

«Эта работа не может быть предпринята только одной группой или одной страной в Латинской Америке: это проблема, которая требует участия каждого», – говорит Альваро Сото, директор Cenia, в интервью Wired En Español. «Latam-GPT-это проект, который стремится создать открытую, свободную и, прежде всего, совместную модель искусственного интеллекта. Мы работаем два года с очень восходящим процессом, объединяя граждан из разных стран, которые хотят сотрудничать. Недавно он также видел еще несколько инициатив сверху вниз, и правительства проявляют интерес и начинают участвовать в проекте».

Проект выделяется своим духом совместной работы. «Мы не хотим конкурировать с OpenAI, DeepSeek или Google. Мы хотим, чтобы модель, специфичная для Латинской Америки и Карибского бассейна, осознавая культурные требования и проблемы, которые это влечет за собой, таких как понимание различных диалектов, историю региона и уникальные культурные аспекты», – объясняет Сото.

Благодаря 33 стратегическим партнерским отношениям с учреждениями в Латинской Америке и Карибском бассейне, проект собрал корпус данных, превышающих восемь терабат текста, эквивалент миллионов книг. Эта информационная база позволила разработать языковую модель с 50 миллиардами параметров, шкалу, которая делает ее сопоставимым с GPT-3.5 и дает ей среднюю или высокую способность выполнять сложные задачи, такие как рассуждения, перевод и ассоциации.

LATAM-GPT обучается в региональной базе данных, которая собирает информацию из 20 латиноамериканских стран и Испании, с впечатляющим общим количеством 2645 500 документов. Распределение данных показывает значительную концентрацию в крупнейших странах региона, причем Бразилия является лидером с 685 000 документов, за которыми следуют Мексика с 385 000, Испания с 325 000, Колумбией с 220 000 и Аргентиной с 210 000 документов. Числа отражают размер этих рынков, их цифровое развитие и доступность структурированного контента.

«Первоначально мы запустим языковую модель. Мы ожидаем, что ее производительность в общих задачах будет близка к показателям крупных коммерческих моделей, но с превосходной производительности в темах, характерных для Латинской Америки. Идея состоит в том, что, если мы спросим его о темах, относящихся к нашему региону, его знания будут гораздо глубже», – объясняет Сото.

Read more:  Пакистан обвиняет Индию в «использовании воды в качестве оружия» и угрозе стабильности – Winnipeg Free Press

Первая модель является отправной точкой для разработки семейства более продвинутых технологий в будущем, в том числе с изображением и видео, а также для масштабирования до более крупных моделей. «Поскольку это открытый проект, мы хотим, чтобы другие учреждения могли его использовать. Группа в Колумбии может адаптировать его для системы школьного образования или в Бразилии могла адаптировать ее для сектора здравоохранения. Идея состоит в том, чтобы открыть дверь для различных организаций для создания конкретных моделей для определенных областей, таких как сельское хозяйство, культура и другие», – объясняет директор Cenia.

2025-09-01 11:00:00


1756751434
#LATAMGPT #Free #открытым #исходным #кодом #совместным #искусственным #интеллектом #Латинской #Америки

Читайте также

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.