APIMart
Deep Agents v0.7 сокращает токены на 65%

Deep Agents v0.7 сокращает токены на 65%

Как Deep Agents v0.7 сокращает входные токены на ход на 65% благодаря настраиваемой обвязке, кратким описаниям инструментов и модульному ПО.

Обзор модели

Deep Agents v0.7 сокращает базовые входные токены на ход на 65%. Это означает меньше фиксированных затрат на промпт при каждом вызове, меньшие расходы на API и больше контекстного пространства для важных частей задачи.

Суть обновления можно сформулировать так:

  • Базовый системный промпт по умолчанию удален
  • Встроенные описания инструментов стали короче
  • Списки задач больше не подключаются автоматически
  • Промежуточное ПО выбирается намеренно, а не поставляется единым пакетом
  • Экономию дает обвязка, а не модель

Проще говоря, если агент делает 10 вызовов, раньше одна и та же фиксированная оболочка отправлялась 10 раз. В v0.7 эта оболочка по умолчанию намного меньше. Поэтому каждый ход содержит более компактный запрос, особенно для простых задач чтения или записи файлов.

Выделяются несколько моментов:

  • Стоимость масштабируется как llm_calls × input_tokens_per_call
  • Прежняя конфигурация отправляла текст о планировании, файловой системе и субагентах, даже когда он не требовался
  • Новая конфигурация передает управление разработчику, который выбирает промпт, инструменты и промежуточное ПО под задачу
  • Наибольшее сокращение дает удаление базового промпта и уменьшение текстов инструментов
  • Длинные многоагентные процессы выигрывают больше всего, потому что фиксированные затраты повторяются на каждом шаге

Вот простое сравнение:

ОбластьДо v0.7v0.7
Базовый промптОтправлялся каждый ходУдален
Описания инструментовДлинныеКороче
Списки задачВключены по умолчаниюПодключаются по желанию
Промежуточное ПОПоставлялось пакетомВыбирается под задачу
Базовые входные токены100%~35%

Главный вывод: v0.7 в меньшей степени меняет модель и в большей — дисциплину промптов. Компактная обвязка сохраняет все 65% экономии. Если снова добавить множество компонентов промежуточного ПО и инструментов, часть преимущества исчезнет.

В этом и состоит суть обновления, на которой строится остальная статья.

Сокращение токенов на 65% в Deep Agents v0.7 до и после изменения обвязки
Сокращение токенов на 65% в Deep Agents v0.7 до и после изменения обвязки

Что изменилось в настраиваемой обвязке

Сокращение токенов на 65% стало результатом изменения данных, которые обвязка добавляет на каждом ходу, а не применения более умной модели. Проще говоря, v0.7 удаляет значительную часть стандартного текста, который раньше сопровождал каждый запрос.

Удален базовый системный промпт и сокращены описания инструментов

До v0.7 обвязка включала стандартный системный промпт, длинные описания инструментов, промежуточное ПО для планирования и логику субагентов в каждый запрос, даже когда задача ничего этого не требовала. В v0.7 обвязка стала настраиваемой, и теперь разработчики решают, что добавлять на каждом ходу.

Основными источниками лишних затрат были стандартный базовый системный промпт и длинные встроенные описания инструментов. Базовый промпт содержал инструкции для инструментов планирования, файловой системы и субагентов и отправлялся каждый ход. В v0.7 он удален. Теперь разработчики могут предоставить текст промпта, подходящий конкретной задаче.

Встроенные описания таких утилит, как ls, read_file и write_file, тоже стали короче. Инструменты работают так же. Вокруг каждого запроса просто стало меньше фиксированного текста. Ни одно из изменений не затрагивает базовую модель. Они лишь снижают токенную нагрузку, которую раньше нес каждый ход.

Списки задач подключаются по желанию, а промежуточное ПО выбирается явно

До v0.7 todoListMiddleware подключалось по умолчанию, поэтому текст планирования уходил на каждом ходу. В v0.7 списки задач стали опциональными. Их нужно добавлять только тогда, когда многоэтапное планирование действительно улучшает задачу.

Тот же подход применяется к остальному стеку промежуточного ПО. FilesystemMiddleware и SubAgentMiddleware больше не входят в стандартный пакет. Теперь разработчики могут собрать только нужные компоненты. Задача чтения файла обходится без логики субагентов. Процесс проверки может подключить промежуточное ПО с контрольным списком лишь тогда, когда оно полезно.

Как оркестрация становится более явной

Практическое изменение просто: система переходит от неявных стандартных настроек к явной конфигурации. Вместо того чтобы обвязка определяла видимые инструменты, запускаемое промежуточное ПО и содержание системного промпта, эти решения принимают разработчики. Теперь они управляют сборкой промпта, видимостью инструментов и промежуточным ПО для каждой задачи.

Эти изменения видны в стандартном стеке агента ниже. [2]

ФункцияДо v0.7v0.7
Базовый системный промптВключен по умолчаниюУдален
Описания инструментовПодробные, встроенныеСокращенные и настраиваемые
Промежуточное ПО списка задачАвтоматически подключалось каждый ходТолько по желанию
Стек промежуточного ПОНеявно объединялсяСоставляется явно

Использование токенов до и после обновления

Изменения обвязки сразу отражаются на данных, отправляемых при каждом ходе. Экономия возникает из-за сокращения фиксированной оболочки запроса, а не из-за изменения пользовательского промпта или модели.

Ход стандартного агента до v0.7

До v0.7 каждый ход включал каркас планирования, файловой системы и субагентов, даже если он не использовался. Текст списков задач и промпты промежуточного ПО тоже добавлялись по умолчанию. В результате большой фиксированный пакет повторялся на каждом ходу.

Ход стандартного агента после v0.7

После v0.7 простая задача чтения файла отправляет только необходимые инструменты и промежуточное ПО. Лишние затраты больше не повторяются между ходами. Базовый системный промпт удален, описания инструментов стали короче, а задача чтения файла больше не несет неиспользуемый текст планирования или субагентов.

Как отмечает Aaron Jewitt, стоимость агента масштабируется как llm_calls × input_tokens_per_call.[1]

Из чего складывается экономия токенов

Вот откуда берется сокращение на 65%.

Компонент обвязкиДо v0.7После v0.7Оценка влияния на токены
Базовый системный промптОтправлялся каждый ходУдаленВысокое
Описания инструментовПолные встроенные описанияСокращеныСреднее
Управление списком задачВключено по умолчаниюТолько по желаниюЗависит от задачи
Стек промежуточного ПОВключен по умолчаниюЯвно составляется под задачуЗависит от задачи
Общий вход на ход100% (базовый уровень)~35%Сокращение на 65%

Наибольшую экономию дают удаление базового промпта и сокращение описаний инструментов. Поэтому выборочное промежуточное ПО и ограниченная видимость инструментов так заметны в повседневных процессах.

В следующем разделе показано, как разработчики сохраняют эту экономию, выбирая только необходимые задаче компоненты обвязки.

Шаблоны настройки обвязки для разработчиков

После фиксации экономии токенов нужно выбрать компактный профиль обвязки для каждой задачи. Экономию обеспечивают небольшие промпты и облегченные настройки по умолчанию. В Deep Agents v0.7 именно обвязка, а не модель, создает большую часть токенных затрат на ход. Поэтому оптимизация Deep Agents v0.7 зависит не столько от выбора модели, сколько от способа сборки обвязки.

Выбирайте только необходимое задаче промежуточное ПО

Используйте промежуточное ПО только тогда, когда задаче нужны контроль доступа, планирование или управление состоянием. В коротких задачах дополнительные уровни лишь увеличивают затраты.

Правило простое: Начинайте с минимального стека промежуточного ПО, необходимого задаче. То же относится к инструментам. Показывайте только те, которые действительно нужны текущей задаче.

Ограничивайте видимость инструментов и сокращайте описания

Показывать все инструменты на каждом ходу — один из самых быстрых способов раздуть входные данные. Узкая видимость инструментов помогает сохранить промпт небольшим.

Краткие описания инструментов дополнительно уменьшают размер промпта. Точные и лаконичные формулировки сокращают его и помогают модели выбрать правильный инструмент без лишнего контекста.

Используйте опциональные списки задач и профили настроек по умолчанию

Списки задач полезны в длительной работе, когда агенту нужно отслеживать прогресс по многим шагам. В коротких одноэтапных задачах они создают затраты, не давая ничего взамен.

Подключайте списки задач для длительной работы по желанию и задавайте облегченные или расширенные настройки для каждого класса агентов. Облегченные настройки класса агентов сохраняют выигрыш в 65% для простых агентов, а более насыщенные профили остаются для процессов с интенсивным планированием.

От этих решений зависит, превратится ли сокращение на 65% в меньшую стоимость и более быстрые итерации при ежедневном использовании.

Значение обновления v0.7 для стоимости, скорости и масштаба

Снижение стоимости вывода и ускорение циклов итераций

Уменьшенная оболочка запроса дает накопительный эффект на каждом ходу длинного процесса. Стоимость токенов складывается во многоходовых запусках, поэтому компактная обвязка экономит не только на первом ходу. Она сохраняет меньшую отправную точку на каждом следующем ходу, а разница растет вместе с диалогом.

Вот как сокращение проявляется на практике:

Фактор стоимостиВлияние сокращения на 65%Ценность для бизнеса
Базовый входБолее низкая отправная точка каждого ходаПрямое снижение расходов на запуск
Накопление контекстаБолее медленный рост истории диалогаПоддержка более долгих и сложных задач
Размер данныхБолее компактные запросыБолее короткие циклы итераций

Небольшие запросы также ускоряют итерации. При проверке изменения промпта или новой конфигурации инструментов облегченные запросы возвращаются быстрее. Это устраняет значительную часть задержек повседневной разработки.

Лучшая масштабируемость долгих и многоагентных процессов

Та же экономия токенов еще важнее, когда несколько агентов используют общий бюджет рабочего процесса. Фиксированные затраты незаметно расходуют бюджет многоагентных систем. Если каждый агент несет избыточную обвязку, затраты умножаются на все скоординированные ходы.

Компактный пакет обвязки уменьшает объем каждого агента. Это повышает пропускную способность и снижает вероятность столкнуться с ограничениями контекста или частоты запросов посреди рабочего процесса.

По мере заполнения контекстных окон производительность может снижаться. Компактная обвязка оставляет каждому агенту больше полезного пространства для реальных данных задачи. Проще говоря, длительные процессы дольше сохраняют точность без слишком раннего вмешательства логики сжатия или суммирования.

Низкие затраты на вызов особенно важны в процессах с большим количеством ходов, агентов или и того и другого. Сокращение токенов на 65% уменьшает стоимость вызова. Но главное преимущество для масштаба дает явная модель оркестрации v0.7. Благодаря четким критериям остановки вместо бесконечных циклов агенты делают меньше вызовов для завершения задачи.

Главные выводы из выпуска Deep Agents v0.7

Deep Agents

Deep Agents v0.7 повышает экономичность и качество благодаря настраиваемой обвязке. Выбор промежуточного ПО, видимость инструментов и настройки на основе профилей определяют, сохранит ли процесс всю экономию или потеряет значительную часть из-за дополнительных затрат.

Конфигурация — главный рычаг оптимизации. Особенно важна она в процессах с множеством ходов, агентов или и того и другого.

Частые вопросы

Как сохранить все 65% экономии токенов в реальных процессах?

Относитесь к конфигурации обвязки как к развивающейся системе, а не к задаче, которую достаточно выполнить один раз. Сначала измерьте использование токенов и количество вызовов LLM. Затем закрепите строгие правила поведения с помощью обвязки.

Используйте PreCompletionChecklistMiddleware для остановки лишних циклов рассуждений. Применяйте LocalContextMiddleware, чтобы передавать только необходимые модели контекст и инструменты. Добавьте кэширование промптов, чтобы системные инструкции оставались стабильными между запусками.

При скачке использования токенов ищите отклонения и ужесточайте правила обвязки.

Для каких задач по-прежнему нужны списки задач или дополнительное промежуточное ПО?

Используйте todoListMiddleware, когда агент решает сложную задачу из нескольких частей. Оно помогает отслеживать завершенные этапы и оставшиеся пункты по мере выполнения работы.

Если указать использование инструмента write_todos в промпте, агент сможет обновлять прогресс при поступлении новых деталей. Это упрощает контроль долгих и сложных процессов и помогает агенту не сбиваться с пути.

Влияет ли меньшая обвязка на качество или надежность агента?

По умолчанию нет. Небольшая настроенная обвязка может сохранить или даже повысить надежность, сокращая токены на ход за счет лучшей работы с контекстом, вынесения действий в инструменты и структурированной упаковки промпта.

Качество сохраняется, когда экономия сочетается с детерминированными ограничителями, такими как циклы проверки и контрольные списки перед завершением. Они помогают агенту сосредоточиться на важных данных задачи и перепроверить работу перед ответом.

Готовы попробовать?

Выберите нужную модель в маркетплейсе моделей

Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.

Чат-моделиМодели изображенийВидео-модели
Открыть маркетплейс моделей