Что такое ИИ-агенты: как нейросети научились действовать

Андрей из LLMost

Андрей из LLMost

· 9 мин чтения

#ии-агенты#нейросети#гайд
Что такое ИИ-агенты: как нейросети научились действовать

Попросите обычный чат-бот спланировать поездку — и получите аккуратный список советов: где искать билеты, на что смотреть при выборе отеля. Полезно, но билеты вы всё равно будете искать сами. Попросите о том же ИИ-агента — и он сам откроет поиск, сравнит рейсы, сведёт варианты в таблицу и вернётся с готовым планом и ссылками.

Это и есть главный сдвиг в мире нейросетей за 2025–2026 годы: ИИ научился не только говорить, но и делать. Разбираемся, как устроены агенты, что они уже умеют, где их слабые места — и как попробовать самому, не будучи программистом.

Чат-бот отвечает, агент — делает

Проще всего понять агентов через три уровня:

  • Языковая модель (LLM) — «мозг», который умеет работать с текстом: принимает вопрос, возвращает ответ. Сама по себе она ничего не помнит между разговорами и ничего не делает во внешнем мире.
  • Чат-бот — интерфейс к этому мозгу: вы пишете, он отвечает. Режим «вопрос — ответ», знакомый всем по ChatGPT.
  • ИИ-агент — тот же мозг, которому дали цель, память, план и инструменты — и запустили в цикле, где он сам решает, что делать дальше, пока не добьётся результата.

Любимая метафора индустрии: чат-бот — это консультант, который рассказывает, как построить дом; агент — подрядчик, который приходит с молотком и строит.

У агентности есть узнаваемые признаки:

  • автономность — не ждёт утверждения каждого шага;
  • инструменты — умеет вызывать поиск, код, API, работать с файлами;
  • планирование — разбивает большую задачу на подзадачи;
  • память — держит контекст задачи, а продвинутые системы помнят и между сессиями;
  • цикл действий — работает итеративно: сделал → посмотрел на результат → скорректировал курс.

Исследовательница Лилиан Вен свела это в формулу, которую с тех пор цитируют все: агент = LLM + память + планирование + инструменты.

Как агент работает под капотом

Секрет агента — не в какой-то особой «агентной модели», а в цикле, в который обернули обычную языковую модель.

Вызов инструментов. Сама модель ничего не исполняет — она лишь пишет запрос: «вызови get_weather("Токио")». Программа-обёртка выполняет вызов и возвращает модели результат. Без инструментов модель может только ответить «у меня нет данных в реальном времени»; с инструментами — реально узнать погоду.

Цикл ReAct (Reason + Act). Агент чередует рассуждение («что мне сейчас нужно?») и действие (вызов инструмента), смотрит на результат и повторяет. Идея пришла из научной работы Яо и соавторов (Принстон и Google, 2022): рассуждение и действия вместе работают заметно лучше, чем по отдельности. Реальная задача — это обычно от 3 до 20 и больше таких итераций.

Память. Краткосрочная — это контекстное окно модели, её «оперативная память» на время задачи: у флагманских моделей от 100 тысяч до миллиона токенов. Долгосрочная — факты и предпочтения, которые агент сохраняет между сессиями в базе данных, чтобы не переспрашивать одно и то же.

Декомпозиция. Большую цель агент режет на шаги. Эндрю Ын ещё в 2024 году описал четыре базовых паттерна агентных процессов: рефлексия (модель проверяет собственную работу), инструменты, планирование и мультиагентное сотрудничество. По его данным, даже GPT-3.5, обёрнутая в агентный цикл, решала задачи по программированию лучше, чем более мощная GPT-4 без цикла.

Какие бывают агенты

Кодинг-агенты — самая зрелая категория: читают репозиторий, правят файлы, запускают тесты и итерируют до зелёного результата. Это расширения редакторов вроде Cline и Roo Code, терминальные агенты вроде OpenCode и goose, автономные инженеры вроде OpenHands.

Браузерные и компьютерные агенты управляют браузером как человек: смотрят на экран, кликают, печатают. Так работают ChatGPT Agent и Gemini Agent.

Исследовательские агенты (Deep Research) сами просматривают десятки источников и собирают структурированный отчёт со ссылками — такие режимы есть у OpenAI, Google и Perplexity.

Персональные ассистенты живут на вашем сервере и работают через мессенджеры: разбирают почту, ведут календарь, выполняют поручения. Яркие примеры — Hermes Agent и OpenClaw.

Мультиагентные системы — команда специализированных агентов под управлением оркестратора: один ищет, другой анализирует, третий пишет отчёт. Из открытых — Agent Zero с иерархией субагентов.

Бизнес-агенты закрывают поддержку клиентов, продажи, скрининг резюме, мониторинг упоминаний бренда.

Что агенты умеют уже сегодня

Для обычного человека самые благодарные сценарии:

  • исследование темы с отчётом и ссылками;
  • планирование поездки: рейсы, отели, маршрут;
  • разбор почты и черновики ответов, выжимки из длинных документов;
  • работа с таблицами и презентациями — на выходе готовые файлы;
  • рутина в вебе: заполнить формы, собрать данные с сайтов.

Для малого бизнеса: первая линия поддержки с эскалацией сложных случаев человеку, исследование лидов и персонализированные письма, суммирование резюме кандидатов, автоматический мониторинг соцсетей.

Хрестоматийный кейс — Klarna: их ИИ-ассистент поддержки за первый месяц провёл 2,3 млн разговоров, взяв на себя две трети обращений — работу, эквивалентную 700 сотрудникам. Важная оговорка: это данные самой компании, объявленные вместе с вендором, а в 2025 году Klarna признала, что автоматизация «зашла слишком далеко», и вернула людей на сложные случаи. Показательны обе половины этой истории: масштаб эффекта — и предел автономности.

Рынок-2026: агенты вышли из лабораторий

За полтора года агенты прошли путь от демо до продуктов. У OpenAI появился ChatGPT Agent с собственным виртуальным компьютером, у Google — Gemini Agent с интеграцией в Gmail и Docs, у Anthropic — Claude Code и Computer Use. Сэм Альтман ещё в январе 2025-го предполагал, что первые агенты в этом году «присоединятся к рабочей силе» — и по части кодинга это уже сбылось.

Отдельная веха — протокол MCP (Model Context Protocol), открытый стандарт подключения ИИ к внешним инструментам и данным, представленный Anthropic в конце 2024 года. Его называют «USB-C для ИИ»: один разъём вместо кастомной интеграции под каждый сервис. Стандарт приняли OpenAI, Microsoft и Google — редкий случай единодушия конкурентов.

Цифры при этом отрезвляют. По опросу McKinsey (ноябрь 2025, почти 2000 компаний из 105 стран), 62% организаций экспериментируют с агентами, но лишь 23% довели их до масштабного использования. Gartner прогнозирует, что более 40% агентских проектов закроются к концу 2027 года — из-за растущих издержек и неясной ценности. Рынок агентного ИИ оценивают примерно в 10 млрд долларов на 2026 год с ростом на 40%+ в год — но это оценки с большим разбросом, и воспринимать их стоит как порядок величины.

Иными словами: технология реальна, хайп — тоже.

Риски: почему агенту нельзя доверять вслепую

Галлюцинации становятся действиями. Обычный чат-бот, ошибившись, выдаёт плохой ответ. Агент, ошибившись, совершает неправильное действие — отправляет не то письмо, удаляет не тот файл. Цена ошибки выше.

Prompt injection. Агент читает внешний контент — письма, документы, веб-страницы — и не может надёжно отличить ваши инструкции от инструкций, спрятанных злоумышленником в этом контенте. В рейтинге OWASP Top 10 для LLM-приложений 2025 года эта атака стоит на первом месте и считается пока нерешённой проблемой. Масштаб иллюстрируют данные Anthropic по Claude Opus 4.5: в агентном кодинге непрямая инъекция срабатывала в 4,7% случаев с одной попытки — и в 63% при ста попытках. Защита — не фильтры, а сдерживание: минимум прав, песочница, подтверждение важных действий человеком.

Стоимость. Одна задача — это десятки вызовов модели, и неудачные прогоны тоже стоят денег. Агентная сессия дороже чата на порядок.

Надёжность. Агент может зациклиться, уйти по ложному пути, «забыть» контекст на длинной задаче.

И главное правило: если задачу решает один хороший запрос к обычному чату — агент не нужен. Он оправдан там, где задача многошаговая и требует действий во внешних системах. Разумная модель работы — «человек в контуре»: агент делает черновую работу, человек проверяет и утверждает важное.

Как начать: пять шагов

  1. Выберите задачу. Одну, конкретную, многошаговую и некритичную при ошибке: ресёрч, планирование, разбор документов.
  2. Выберите инструмент. Готовые режимы в ChatGPT/Gemini — по подписке. А в каталоге ИИ-агентов LLMost — два десятка бесплатных приложений с пошаговыми инструкциями: от кодинг-агентов до персональных ассистентов в Telegram.
  3. Подключите модель. Почти все открытые агенты подключаются к любой модели через три параметра: адрес API (base URL), API-ключ и имя модели. Это универсальная «розетка» индустрии — OpenAI-совместимый API. С ключом LLMost в неё подключаются все модели каталога: GPT, Claude, Gemini, DeepSeek и сотни других, с оплатой в рублях.
  4. Формулируйте задачу правильно. Конкретика (формат, объём, тон), контекст, роль («ты — ассистент по…»), инструкция на случай нехватки данных: переспросить, а не выдумывать.
  5. Проверяйте. Начинайте с режима, где агент спрашивает подтверждение перед действиями, и не утверждайте важное вслепую.

Для разработчиков

Если коротко, любой агент — это цикл: модель получает состояние (историю + описания инструментов), решает — вызвать инструмент, передать задачу другому агенту или дать финальный ответ, — runtime исполняет решение и дописывает результат в состояние. Инструменты полезно делить на три класса: data (получение контекста), action (побочные эффекты) и orchestration (вызов других агентов).

Из фреймворков в 2026 году: LangGraph — выбор по умолчанию для сложных stateful-процессов, CrewAI — быстрейший путь к мультиагентному прототипу, OpenAI Agents SDK — для GPT-центричных сценариев, Microsoft Agent Framework и Google ADK — для своих экосистем.

Практический вывод: почти всё это работает с любой моделью через OpenAI-совместимый API — достаточно поменять base_url, ключ и имя модели. Как это выглядит с LLMost — в документации: базовый URL https://llmost.ru/api/v1, дальше всё как с OpenAI SDK. Лучшие практики безопасности стандартные: минимум прав и песочница для инструментов, человек в контуре для рискованных действий, трейсинг и учёт стоимости на своих задачах, а не по чужим бенчмаркам.

Вместо заключения

Агенты — не магия и не маркетинговый пузырь, а следующий логичный слой поверх языковых моделей: цикл, инструменты и память превращают «умного собеседника» в исполнителя. В 2026 году они уже реально экономят часы на рутине — если давать им правильные задачи и не доверять вслепую.

Попробовать проще, чем кажется: выберите приложение в каталоге ИИ-агентов, создайте API-ключ LLMost — и первый агент заработает у вас сегодня же, на любой из сотен моделей каталога.

Начните работать с ИИ сегодня

Получите доступ к 300+ моделям, включая GPT-5.5, Claude и Gemini. Без VPN, без иностранных карт. Без привязки карты.

Что такое ИИ-агент простыми словами: полный гайд 2026 | LLMost