Google представил Langextractan Библиотека Python с открытым исходным кодом предназначен для того, чтобы помочь разработчикам извлечь структурированную информацию из неструктурированного текста с использованием крупных языковых моделей, таких как Модели БлизнецовПолем Библиотека упрощает процесс преобразования текста свободной формы, включая такие документы, как клинические заметки, юридические тексты и отзывы клиентов, в структурированные данные. Разработчики могут определять задачи экстракции с помощью инструкций по естественному языку и примеров данных, облегчая обработку и организацию информации из различных типов неструктурированного контента.
Одной из выдающихся особенностей Langextract является использование его использования Контролируемые методы генерацииПолем Это гарантирует, что извлеченная информация последовательно отформатирована и точно связана с исходным источником в тексте. Библиотека подчеркивает соответствующие пролеты текста, обеспечивая прослеживаемость так, чтобы каждая извлеченная сущность была связана с точным местоположением в исходном документе. Эта функция обеспечивает большую прозрачность и надежность при извлечении информации.
Для обработки длинных и сложных документов Langextract включает в себя расширенные стратегии, такие как Текстовый блюдВ параллельная обработкаи несколько проходов извлеченияПолем Эти методы помогают улучшить отзыв и точность, гарантируя, что библиотека могла эффективно извлекать информацию из больших тел текста, сохраняя при этом высококачественные результаты. Это делает Langextract подходящим для приложений в различных областях, от здравоохранения до юридических документов, без необходимости обширной настройки базовых моделей.
Langextract может быть интегрирован с различными LLM, включая облачные модели, такие как Близнецы и локальные модели через платформы, такие как ОлламаПолем Эта гибкость делает его универсальным инструментом для разработчиков, работающих в разных моделях. Это позволяет пользователям определять задачи извлечения для широкого спектра приложений, не требуя глубокого опыта в машинном обучении.
Выпуск Langextract вызвал восторженные ответы в сообществе разработчиков. Акшай Гоэльключевой участник, выразил свое волнение по поводу выпуска и стремления видеть инновационные приложения от пользователей, отражая дух совместной работы, стоящий за проектом, публикуя:
Взволнован, чтобы выпустить Langextract вместе с командой сегодня и с нетерпением жду возможности увидеть, что создает сообщество разработчиков!
Разработчик Кайл Браун Описал его как основной шаг вперед в прозрачности ИИ, преобразуя неструктурированный текст в структурированные, понятные данные. В дополнение к импульсу в порт TypeScript Langextract, расширение его совместимости для поддержки как моделей Openai, так и Gemini Google, демонстрируя активное участие сообщества.
Для тех, кто заинтересован – я перенес это в TypeScript и добавил возможность использовать OpenAI, а не только Близнецы.
Библиотека доступна по лицензии Apache 2.0 и может быть легко установлена через PIP. Он предлагает доступный и мощный инструмент для разработчиков, желающих добавить возможности извлечения информации в свои приложения.
2025-08-08 10:27:00
1754649651
#Google #запустил #Langextract #библиотеку #Python #для #извлечения #структурированных #данных #из #неструктурированного #текста
Продолжение темы
