Что такое LFM2.5-2.6B
LFM2.5-2.6B – языковая модель, заточенная под локальный запуск: ноутбук, десктоп, а то и телефон сгодятся. Она входит в семейство LFM2.5 от Liquid AI и стоит на архитектуре LFM2 – той самой, которую разработчики с самого начала проектировали именно под on-device сценарии, а не под облачные дата-центры. Главная её особенность – сочетание скромного размера (2,69 млрд параметров) с агентными способностями, которые обычно требуют моделей куда крупнее.
Круг задач у модели: работа с инструментами (tool use), извлечение данных, RAG-сценарии и long-context workflows с окном контекста в 128 тысяч токенов. Для агентного программирования и всего, что требует глубоких фоновых знаний, модель не подойдёт. Это не универсальный комбайн, а инструмент под конкретный класс задач.
Пригодится она разработчикам, которые собирают агентов и хотят гонять их локально, без бесконечных обращений к внешним API. Актуально это для приложений с ограниченным доступом к интернету, для продуктов с жёсткими требованиями к приватности или там, где критична низкая задержка ответа. Модель также интересна тем, кто занимается edge-развёртыванием – Liquid AI отдельно упоминает, что по кастомным решениям можно связаться с их sales-командой.
На Hugging Face модель лежит в виде готовых квантизаций для llama.cpp, Ollama и LM Studio, а ещё поддерживается через Transformers, vLLM, SGLang и Docker Model Runner. Такой набор инструментов инференса делает её доступной и для быстрого локального теста, и для полноценного продакшена.

Ключевые возможности LFM2.5-2.6B
Агентные способности и tool use
LFM2.5-2.6B умеет вызывать внешние функции и работать в связке с инструментами. Это база для агентов, которые не просто отвечают текстом, а выполняют действия: ищут информацию, обращаются к API, парсят данные.
Проблема, которую это решает: не нужна модель на десятки миллиардов параметров, чтобы собрать рабочего агента. LFM2.5-2.6B конкурентна с моделями в 4 раза крупнее – по tool use, следованию инструкциям и многошаговым агентным задачам.
На практике вызов функций устроен в четыре шага:
- Список инструментов передаётся в системный промпт (или через tokenizer.apply_chat_template() с параметром tools=);
- Модель формирует вызов функции в виде Python-подобной конструкции между спецтокенами tool_call_start и tool_call_end;
- Вызов выполняется во внешнем коде, а результат возвращается модели через роль tool;
- Модель выдаёт финальный текстовый ответ.
По умолчанию модель пишет вызовы в «питоническом» стиле, но можно попросить её выдавать JSON – настраивается это через системный промпт.
Длинный контекст на 128K токенов
Модель держит контекстное окно в 131 072 токена – можно загружать в один запрос увесистые документы, целую историю переписки или большие наборы данных, не обрезая их.
Для пользователя это решает вполне конкретную задачу: не нужно дробить длинные тексты на куски и терять связность между ними. Особенно важно это для RAG-сценариев, где нейросети нужно удерживать в поле зрения сразу несколько найденных фрагментов документов.
На практике это может выглядеть так: загружаете целый технический мануал или большой лог переговоров – и просите извлечь конкретные данные или составить сводку. Отдельно можно назвать long-context workflows среди рекомендованных сценариев использования.
Эффективный локальный инференс
Работает LFM2.5-2.6B быстро даже на потребительском железе. Цифры: 220 токенов в секунду на Apple M5 Max, 113 токенов в секунду на процессоре AMD Ryzen – при этом сама модель занимает менее 2,5 ГБ памяти.
Это решает проблему при локальной работе с языковыми моделями – нехватку видеопамяти и вычислительной мощности. Благодаря архитектуре LFM2 модель оказалась самой быстрой среди протестированных в своём размерном классе.
На практике скорости в 30 токенов в секунду уже хватает для рабочих агентов на смартфоне. А в облаке, на одном H100, при высокой параллельности модель выдаёт почти 15 тысяч токенов в секунду суммарно – это порядка 1,3 млрд токенов в день.
Ограничение: высокая скорость и компактность достигаются за счёт узкой специализации. Для сценариев, требующих широких фоновых знаний или сложной генерации кода, лучше смотреть в сторону других моделей.
Поддержка популярных фреймворков инференса
Запустить модель можно через Transformers, vLLM, SGLang, Docker Model Runner, а ещё через llama.cpp, Ollama и LM Studio с помощью готовых квантизаций.
Так решается практическая проблема выбора инструмента: разработчику не приходится ломать существующий пайплайн под единственный поддерживаемый backend – можно использовать то, что уже стоит в инфраструктуре.
Для быстрого локального теста достаточно установить vLLM командой pip install vllm, запустить сервер vllm serve LiquidAI/LFM2.5-2.6B и обращаться к нему через OpenAI-совместимый API обычным curl-запросом. Похожим образом всё работает через SGLang или напрямую через Docker: docker model run hf.co/LiquidAI/LFM2.5-2.6B.
Многоязычная поддержка
Модель обучена на 16 языках, среди которых русский, английский, китайский, арабский, немецкий, французский, японский, корейский, испанский и другие.
Это расширяет область применения модели далеко за пределы англоязычных сценариев, что немаловажно для команд, работающих с многоязычными данными, или для тех, кто строит продукты сразу под несколько региональных рынков.
На практике это значит, что запросы и ответы на русском или, скажем, вьетнамском языке модель обрабатывает без предварительного перевода на английский.
Условия использования LFM2.5-2.6B
LFM2.5-2.6B распространяется как бесплатный проект. Платные тарифы, подписки и лимиты использования отсутствуют.
Часто задаваемые вопросы
Что такое LFM2.5-2.6B
LFM2.5-2.6B – языковая модель от Liquid AI из семейства LFM2.5, построенная на архитектуре LFM2 и предназначенная для локального запуска на ноутбуке, десктопе или смартфоне. Модель насчитывает 2,69 млрд параметров, но при этом обладает агентными способностями, характерными обычно для куда более крупных моделей. Это reasoning-модель – она всегда формирует внутренние рассуждения перед финальным ответом.
Для чего нужен LFM2.5-2.6B
Модель заточена под работу с инструментами (tool use), извлечение данных, RAG-сценарии и long-context workflows с окном контекста в 128 тысяч токенов. Она позволяет запускать агентов локально, без постоянных обращений к внешним API. Для агентного программирования и задач, требующих глубоких фоновых знаний, модель не подходит.
Кому подойдет LFM2.5-2.6B
Модель пригодится разработчикам, которые собирают агентов и хотят запускать их локально. Она актуальна для приложений с ограниченным доступом к интернету, продуктов с высокими требованиями к приватности и сценариев, где важна низкая задержка ответа. Также модель интересна для edge-развёртывания – по кастомным решениям Liquid AI предлагает связаться с их sales-командой.
Какие возможности LFM2.5-2.6B стоит выделить
Среди ключевых возможностей – вызов внешних функций (tool use), контекстное окно в 131 072 токена, поддержка 16 языков, включая русский, и быстрый инференс на потребительском железе. Модель конкурентна с аналогами в 4 раза крупнее по tool use и следованию инструкциям. Также она поддерживается сразу несколькими фреймворками инференса – от Transformers до llama.cpp.
Как пользоваться LFM2.5-2.6B
Модель доступна на Hugging Face в виде готовых квантизаций для llama.cpp, Ollama и LM Studio, а также поддерживается через Transformers, vLLM, SGLang и Docker Model Runner. Для быстрого теста достаточно установить vLLM командой pip install vllm и запустить сервер командой vllm serve, после чего обращаться к модели через OpenAI-совместимый API. Для работы с инструментами дополнительно нужен agent harness, настроенный на порт нужного backend – например, 8000 у vLLM или 8080 у llama.cpp.
Есть ли бесплатный тариф у LFM2.5-2.6B
LFM2.5-2.6B распространяется как бесплатный проект.
Какие есть ограничения у LFM2.5-2.6B
Модель не подходит для агентного программирования и задач, требующих широких фоновых знаний или сложной генерации кода.
Насколько быстро работает LFM2.5-2.6B на локальном железе
Цифры в 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на процессоре AMD Ryzen, при этом сама модель занимает менее 2,5 ГБ памяти. По словам Liquid AI, скорости около 30 токенов в секунду уже достаточно для работы агентов на смартфоне. В облаке на одном H100 при высокой параллельности модель способна выдавать почти 15 тысяч токенов в секунду суммарно.
Чем LFM2.5-2.6B отличается от других компактных моделей
Главное отличие – сочетание небольшого размера в 2,69 млрд параметров с агентными способностями, обычно свойственными моделям в разы крупнее. В отличие от многих компактных моделей, где режим рассуждений отсутствует или включается опционально, LFM2.5-2.6B всегда «думает» перед финальным ответом, добавляя тег think в шаблон чата.