LFM2.5-2.6B — Чат-бот на основе нейросети

×

СГЕНЕРИРУЙ РЕФЕРАТ, КУРСОВУЮ И ДИПЛОМ

Со скидкой 5%

LFM2.5-2.6B

Скриншот ИИ-сервиса LFM2.5-2.6B
0
Сфера: LLM
Условия использования: Бесплатные
Доступ к API: Да
Поделиться:
Попробовать

Нужна оплата зарубежного сервиса?

Оплата зарубежных ИИ-сервисов с помощью виртуальной карты.

Подробнее

Что такое LFM2.5-2.6B

LFM2.5-2.6B – языковая модель, заточенная под локальный запуск: ноутбук, десктоп, а то и телефон сгодятся. Она входит в семейство LFM2.5 от Liquid AI и стоит на архитектуре LFM2 – той самой, которую разработчики с самого начала проектировали именно под on-device сценарии, а не под облачные дата-центры. Главная её особенность – сочетание скромного размера (2,69 млрд параметров) с агентными способностями, которые обычно требуют моделей куда крупнее.

Круг задач у модели: работа с инструментами (tool use), извлечение данных, RAG-сценарии и long-context workflows с окном контекста в 128 тысяч токенов. Для агентного программирования и всего, что требует глубоких фоновых знаний, модель не подойдёт. Это не универсальный комбайн, а инструмент под конкретный класс задач.

Пригодится она разработчикам, которые собирают агентов и хотят гонять их локально, без бесконечных обращений к внешним API. Актуально это для приложений с ограниченным доступом к интернету, для продуктов с жёсткими требованиями к приватности или там, где критична низкая задержка ответа. Модель также интересна тем, кто занимается edge-развёртыванием – Liquid AI отдельно упоминает, что по кастомным решениям можно связаться с их sales-командой.

LFM2.5-2.6B – это reasoning-модель, она всегда «думает» перед тем, как выдать финальный ответ, добавляя в шаблон чата тег think. Этим она отличается от многих компактных моделей, где режим рассуждений либо вовсе отсутствует, либо включается по желанию.

На Hugging Face модель лежит в виде готовых квантизаций для llama.cpp, Ollama и LM Studio, а ещё поддерживается через Transformers, vLLM, SGLang и Docker Model Runner. Такой набор инструментов инференса делает её доступной и для быстрого локального теста, и для полноценного продакшена.

сравнение моделей

Ключевые возможности LFM2.5-2.6B

Агентные способности и tool use

LFM2.5-2.6B умеет вызывать внешние функции и работать в связке с инструментами. Это база для агентов, которые не просто отвечают текстом, а выполняют действия: ищут информацию, обращаются к API, парсят данные.

Проблема, которую это решает: не нужна модель на десятки миллиардов параметров, чтобы собрать рабочего агента. LFM2.5-2.6B конкурентна с моделями в 4 раза крупнее – по tool use, следованию инструкциям и многошаговым агентным задачам.

На практике вызов функций устроен в четыре шага:

  • Список инструментов передаётся в системный промпт (или через tokenizer.apply_chat_template() с параметром tools=);
  • Модель формирует вызов функции в виде Python-подобной конструкции между спецтокенами tool_call_start и tool_call_end;
  • Вызов выполняется во внешнем коде, а результат возвращается модели через роль tool;
  • Модель выдаёт финальный текстовый ответ.

По умолчанию модель пишет вызовы в «питоническом» стиле, но можно попросить её выдавать JSON – настраивается это через системный промпт.

Чтобы всё заработало на практике, нужен OpenAI-совместимый backend (vLLM, SGLang, llama.cpp и прочие) и agent harness, настроенный на нужный порт, а порт у каждого backend свой.

Длинный контекст на 128K токенов

Модель держит контекстное окно в 131 072 токена – можно загружать в один запрос увесистые документы, целую историю переписки или большие наборы данных, не обрезая их.

Для пользователя это решает вполне конкретную задачу: не нужно дробить длинные тексты на куски и терять связность между ними. Особенно важно это для RAG-сценариев, где нейросети нужно удерживать в поле зрения сразу несколько найденных фрагментов документов.

На практике это может выглядеть так: загружаете целый технический мануал или большой лог переговоров – и просите извлечь конкретные данные или составить сводку. Отдельно можно назвать long-context workflows среди рекомендованных сценариев использования.

Эффективный локальный инференс

Работает LFM2.5-2.6B быстро даже на потребительском железе. Цифры: 220 токенов в секунду на Apple M5 Max, 113 токенов в секунду на процессоре AMD Ryzen – при этом сама модель занимает менее 2,5 ГБ памяти.

Это решает проблему при локальной работе с языковыми моделями – нехватку видеопамяти и вычислительной мощности. Благодаря архитектуре LFM2 модель оказалась самой быстрой среди протестированных в своём размерном классе.

На практике скорости в 30 токенов в секунду уже хватает для рабочих агентов на смартфоне. А в облаке, на одном H100, при высокой параллельности модель выдаёт почти 15 тысяч токенов в секунду суммарно – это порядка 1,3 млрд токенов в день.

Ограничение: высокая скорость и компактность достигаются за счёт узкой специализации. Для сценариев, требующих широких фоновых знаний или сложной генерации кода, лучше смотреть в сторону других моделей.

Поддержка популярных фреймворков инференса

Запустить модель можно через Transformers, vLLM, SGLang, Docker Model Runner, а ещё через llama.cpp, Ollama и LM Studio с помощью готовых квантизаций.

Так решается практическая проблема выбора инструмента: разработчику не приходится ломать существующий пайплайн под единственный поддерживаемый backend – можно использовать то, что уже стоит в инфраструктуре.

Для быстрого локального теста достаточно установить vLLM командой pip install vllm, запустить сервер vllm serve LiquidAI/LFM2.5-2.6B и обращаться к нему через OpenAI-совместимый API обычным curl-запросом. Похожим образом всё работает через SGLang или напрямую через Docker: docker model run hf.co/LiquidAI/LFM2.5-2.6B.

Порт сервера различается в зависимости от backend – 8080 у llama.cpp и MLX, 8000 у vLLM, 30000 у SGLang, 1234 у LM Studio. При настройке agent harness это придётся учитывать вручную.

Многоязычная поддержка

Модель обучена на 16 языках, среди которых русский, английский, китайский, арабский, немецкий, французский, японский, корейский, испанский и другие.

Это расширяет область применения модели далеко за пределы англоязычных сценариев, что немаловажно для команд, работающих с многоязычными данными, или для тех, кто строит продукты сразу под несколько региональных рынков.

На практике это значит, что запросы и ответы на русском или, скажем, вьетнамском языке модель обрабатывает без предварительного перевода на английский.

Условия использования LFM2.5-2.6B

LFM2.5-2.6B распространяется как бесплатный проект. Платные тарифы, подписки и лимиты использования отсутствуют.

Часто задаваемые вопросы

Что такое LFM2.5-2.6B

LFM2.5-2.6B – языковая модель от Liquid AI из семейства LFM2.5, построенная на архитектуре LFM2 и предназначенная для локального запуска на ноутбуке, десктопе или смартфоне. Модель насчитывает 2,69 млрд параметров, но при этом обладает агентными способностями, характерными обычно для куда более крупных моделей. Это reasoning-модель – она всегда формирует внутренние рассуждения перед финальным ответом.

Для чего нужен LFM2.5-2.6B

Модель заточена под работу с инструментами (tool use), извлечение данных, RAG-сценарии и long-context workflows с окном контекста в 128 тысяч токенов. Она позволяет запускать агентов локально, без постоянных обращений к внешним API. Для агентного программирования и задач, требующих глубоких фоновых знаний, модель не подходит.

Кому подойдет LFM2.5-2.6B

Модель пригодится разработчикам, которые собирают агентов и хотят запускать их локально. Она актуальна для приложений с ограниченным доступом к интернету, продуктов с высокими требованиями к приватности и сценариев, где важна низкая задержка ответа. Также модель интересна для edge-развёртывания – по кастомным решениям Liquid AI предлагает связаться с их sales-командой.

Какие возможности LFM2.5-2.6B стоит выделить

Среди ключевых возможностей – вызов внешних функций (tool use), контекстное окно в 131 072 токена, поддержка 16 языков, включая русский, и быстрый инференс на потребительском железе. Модель конкурентна с аналогами в 4 раза крупнее по tool use и следованию инструкциям. Также она поддерживается сразу несколькими фреймворками инференса – от Transformers до llama.cpp.

Как пользоваться LFM2.5-2.6B

Модель доступна на Hugging Face в виде готовых квантизаций для llama.cpp, Ollama и LM Studio, а также поддерживается через Transformers, vLLM, SGLang и Docker Model Runner. Для быстрого теста достаточно установить vLLM командой pip install vllm и запустить сервер командой vllm serve, после чего обращаться к модели через OpenAI-совместимый API. Для работы с инструментами дополнительно нужен agent harness, настроенный на порт нужного backend – например, 8000 у vLLM или 8080 у llama.cpp.

Есть ли бесплатный тариф у LFM2.5-2.6B

LFM2.5-2.6B распространяется как бесплатный проект.

Какие есть ограничения у LFM2.5-2.6B

Модель не подходит для агентного программирования и задач, требующих широких фоновых знаний или сложной генерации кода.

Насколько быстро работает LFM2.5-2.6B на локальном железе

Цифры в 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на процессоре AMD Ryzen, при этом сама модель занимает менее 2,5 ГБ памяти. По словам Liquid AI, скорости около 30 токенов в секунду уже достаточно для работы агентов на смартфоне. В облаке на одном H100 при высокой параллельности модель способна выдавать почти 15 тысяч токенов в секунду суммарно.

Чем LFM2.5-2.6B отличается от других компактных моделей

Главное отличие – сочетание небольшого размера в 2,69 млрд параметров с агентными способностями, обычно свойственными моделям в разы крупнее. В отличие от многих компактных моделей, где режим рассуждений отсутствует или включается опционально, LFM2.5-2.6B всегда «думает» перед финальным ответом, добавляя тег think в шаблон чата.