Что нового в последней модели DeepSeek: DeepSeek-V3.2-EXP

Анна Барклай | Getty Images News | Getty Images

Последняя экспериментальная модель китайского стартапа Deepseek обещает повысить эффективность и повысить способность ИИ обрабатывать много информации за небольшую часть затрат, но остаются вопросы относительно того, насколько эффективна и безопасна архитектура.

Deepseek отправил Силиконовую долину в безумие, когда в прошлом году она запустила свою первую модель R1 из ниоткуда, показывая, что можно быстро обучить большие языковые модели (LLMS) на менее мощных чипах, используя меньше ресурсов.

Компания выпустила DeepSeek-V3.2-EXP в понедельник, экспериментальную версию своей нынешней модели DeepSeek-V3.1, которая дополнительно создает свою миссию по повышению эффективности в системах ИИ, Согласно сообщению на форуме ИИ, обнимающего лицоПолем

«Deepseek v3.2 продолжает акцент на эффективность, снижение затрат и разделение с открытым исходным кодом»,-сказала CNBC, ведущая китайская община в обнимательном лице, Адина Якефу. «Большое улучшение – это новая функция под названием DSA (DeepSeek Sparsy Attity), которая делает ИИ лучше для обработки длинных документов и разговоров. Он также сокращает стоимость запуска ИИ пополам по сравнению с предыдущей версией».

«Это важно, потому что модель должна сделать модель быстрее и экономически эффективной для использования без заметного падения производительности»,-сказал Ник Терпенс, вице-президент и практическая руководителя для ИИ в группе Futurum. «Это делает влиятельного ИИ более доступным для разработчиков, исследователей и небольших компаний, что может привести к волне новых и инновационных приложений».

Плюсы и минусы редкого внимания

Модель ИИ принимает решения на основе своих учебных данных и новой информации, такой как подсказка. Скажем, авиакомпания хочет найти лучший маршрут от A до B, в то время как есть много вариантов, не все возможны. Отфильтровывая менее жизнеспособные маршруты, вы резко сокращаете количество времени, топлива и, в конечном счете, денег, необходимых для путешествия. Это точно так же, что уделяется, что это только факторы в данных, которые, по его мнению, важны, учитывая задачу, в отличие от других моделей, которые набрали все данные в модели.

Read more:  Трамп объявляет, что он будет председательствовать в целевой группе Белого дома на Олимпийские игры в Лос -Анджелесе 2028 года | LA Olympic Games 2028

«Таким образом, вы вырезаете вещи, которые, по вашему мнению, не важны», – сказала Экатерина Альмас, соучредитель и управляющий партнер New Venture Capital Fund Fund Capital.

Разреженное внимание – это благо для эффективности и способность масштабировать ИИ с учетом меньшего количества ресурсов, но одна из них заключается в том, что это может привести к снижению того, как надежные модели из -за отсутствия надзора в том, как и почему она скизывает информацию.

“Реальность такова, они [sparse attention models] потеряли много нюансов, – сказал Алмаске, который был ранним сторонником DataIku и DarkTrace, и инвестор в GraphCore. – А потом действительно ли у них есть правильный механизм, чтобы исключить не важные данные, или существует механизм, исключающий действительно важные данные, и тогда результат будет намного менее актуальным? »

Это может быть особенно проблематичным для безопасности и инклюзивности ИИ, отметил инвестор, добавив, что это не может быть «оптимальной или самой безопасной« моделью ИИ », которую можно использовать по сравнению с конкурентами или традиционными архитектурами.

DeepSeek, однако, говорит, что экспериментальная модель работает на уровне своего V3.1-конце. Несмотря на спекуляцию образец пузырькаИИ остается в центре геополитической конкуренции с США и Китаем, борющимися за победное место. Yakefu отметил, что модели Deepseek работают «прямо из коробки» с китайскими чипсами ИИ, таких как восхождение и Cambricon, что означает, что они могут работать локально на домашнем оборудовании без какой-либо дополнительной настройки.

По ее словам, DeepSeek также поделилась фактическим кодом программирования и инструментами, необходимыми для использования экспериментальной модели. «Это означает, что другие люди могут учиться на нем и построить свои собственные улучшения».

Read more:  Трамп сообщил авиакомпаниям, что воздушное пространство Венесуэлы «полностью закрыто» в результате последней эскалации

Но для Альмаса сама природа этого означает, что технология не может быть оправданной. «Этот подход не очень новый», – сказала она, отметив, что отрасль «говорит о редких моделях с 2015 года», и что DeepSeek не способен патентировать с технологией из -за того, что он является открытым исходным кодом. Поэтому конкурентное преимущество Deepseek должно лежать в том, как она решает, какую информацию включить, добавила она.

Сама компания признает, что V3.2-EXP-это «промежуточный шаг к нашей архитектуре следующего поколения», согласно сообщению об объятии лица.

Как отмечалось терпение, «это ценность DeepSeek во всем: эффективность становится такой же важной, как и необработанная сила».

«Deepseek играет в долгую игру, чтобы сообщество инвестировало в их прогресс», – добавил Якефу. «Люди всегда пойдут на то, что дешево, надежно и эффективно».

2025-09-30 08:43:00


1759222477
#Что #нового #последней #модели #DeepSeek #DeepSeekV3.2EXP

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.