Набор для AI-агентов, которые тестируют интерфейс 1С:Предприятия через 1c-testpilot — MCP-сервер ROCTUP.
ROCTUP/1c-testpilot подключается к клиенту тестирования 1С напрямую, по его сетевому протоколу, без менеджера тестирования и без BSL-сценариев. Агент открывает формы, заполняет поля и таблицы, нажимает кнопки, читает окна ошибок — один шаг, один вызов инструмента.
Чем он хорош на практике:
- Проверяемость. Мутирующие действия возвращают
value_before/value_afterи признак проверки. Агенту не нужно отдельно перечитывать поле, чтобы понять, встало ли значение. - Экономия контекста. Снимки формы и их сравнение дают несколько строк изменений вместо дерева из сотен элементов.
- Пакетное заполнение.
set_fieldsиadd_rowsзаполняют десятки полей и строк за вызов. - Сам поднимает клиент. Профили запуска, изолированный рабочий стол, штатная остановка.
- Python API и pytest. Сценарий, пройденный агентом, превращается в тест, который гоняется без модели.
В нашем сравнении на одинаковом сценарии агент с testpilot расходовал около 62 % токенов агента с Тестером и укладывался в половину времени. Проект живой: с 17 по 23 сентября 2026 года вышли версии 1.5, 1.6 и 1.7, у него есть внешние контрибьюторы, две грабли из скилла ниже заведены у автора как issue.
Если вы тестируете 1С агентами — начните с его репозитория, а этот набор подключите сверху.
| Папка | Что внутри |
|---|---|
skill/testpilot-1c/ |
Скилл для Claude Code: канонический поток, 11 граблей, проверенных прогонами, режим наблюдения, Python API, экономия контекста |
agents/tester-1c.md |
Агент-тестировщик для Claude Code: роль, честный вердикт с доказательствами, работа через папку сеанса. Пилотный: в работе пока с десяток прогонов |
benchmark/ |
Сложный сценарий с шестью ловушками, методика оценки по 16 точкам, протоколы и результаты восьми прогонов Claude и Codex |
scripts/ |
Подсчет токенов, времени и стоимости прогона по журналам Claude Code и Codex CLI |
Один и тот же сценарий на 1С:ERP 2.5 («заказ → счет → оплата» с ловушками), документы каждого прогона сверены запросом к базе. По одному прогону на вариант — это наблюдение, а не рейтинг.
| Агент и модель | Точки из 16 | Минуты | Стоимость |
|---|---|---|---|
| Claude Code, Opus 5.5 medium | 16 | 10,5 | $5,66 |
| Claude Code, Sonnet 5.5 high | 16 | 9,0 | $4,64 |
| Codex CLI, GPT-6 Luna high | 16 | 17,0 | $0,24 |
| Codex CLI, GPT-6 Sol medium | 15,5 | 10,2 | $2,31 |
| Claude Code, Sonnet 5 medium | 15 | 13,5 | $6,14 |
| Claude Code, Sonnet 5.5 medium | 14 | 6,8 | $3,45 |
| Codex CLI, GPT-6 Luna medium | 5 | 3,7 | $0,04 |
| Claude Code, Haiku 4.5 | 1 | 4,2 | $1,00 |
Интерактивный отчет
(он же на claude.ai, исходник —
benchmark/report.html). Подробно текстом —
benchmark/results.md.
- Поставьте 1c-testpilot по его README и подключите MCP-сервер к агенту.
- Скопируйте
skill/testpilot-1c/в каталог скиллов Claude Code (~/.claude/skills/или.claude/skills/проекта) и заполните вSKILL.mdраздел «Окружение» своими путями. - По желанию —
agents/tester-1c.mdв~/.claude/agents/, путь к серверу в его заголовке заменить на свой. - Другому агенту (Codex и т.п.) достаточно дать путь к
SKILL.mdв промпте: он прочитает его сам.
- Скилл и методика написаны на русском: целевая аудитория — разработчики 1С.
- Бенчмарк сделан на английском интерфейсе 1С:ERP 2.5.27 с набором тестовых данных; предусловия
перечислены в
benchmark/METHOD.md. На другой конфигурации сценарий придется адаптировать. - Грабли проверены на testpilot 1.7.1 и платформе 8.3.27. В новых версиях часть может уйти.
MIT — см. LICENSE. Сам testpilot распространяется автором под AGPL-3.0, его код здесь
не содержится.