LenserFight: Локальная платформа для оценки ИИ-агентов и подсказок
LenserFight, от Conectlens, является открытой платформой для проектирования и оценки AI-агентов, повторно используемых подсказок и рабочих процессов оценки. Она служит лабораторией AI, которая позволяет командам создавать версионированные "Lenses", запускать направленные ациклические графовые рабочие процессы и организовывать события оценки, которые смешивают оценку по рубрикам с человеческим суждением. Инструмент включает сервер Протокола Контекста Модели (MCP), варианты локального выполнения модели и публичную арену для общих логов. Целевая аудитория - разработчики AI, инженеры подсказок и исследователи, сосредоточенные на воспроизводимой оценке и частном бенчмаркинге.
Какие задачи платформа позволяет задавать и воспроизводить?
Платформа рассматривает задачу как формальный "Lens", версионированную спецификацию, которая сочетает в себе подсказку, оценочный рубрикатор и необязательную схему для структурированных выходных данных. Lenses действуют как многоразовые тестовые случаи, чтобы команды могли выполнять идентичные инструкции на разных моделях и сохранять версии для аудита. Этот дизайн поддерживает структурированные оценочные артефакты, а не случайные подсказки, что помогает при сравнении результатов между запусками моделей или воспроизведении экспериментов.
Как производятся и сравниваются оценки?
Оценочные события используют двойную модель оценки, сочетая автоматизированную оценку рубрикатора с голосами, управляемыми сообществом, для создания публичных таблиц лидеров и рейтингов в стиле ELO. Это сочетание направлено на балансировку объективных метрик рубрикатора с качественными человеческими суждениями. Надежность зависит от дизайна рубрикатора и выборки человеческих голосующих, поэтому сравнения могут быть воспроизводимы только в той мере, в какой это возможно с Lenses и записанными журналами выполнения, которые сопровождают каждый запуск.
Какие входные данные и среды выполнения поддерживаются?
Сервер MCP предоставляет более тридцати инструментов для интеграции с клиентами Model Context Protocol, а платформа поддерживает локальную оркестрацию моделей через Ollama, vLLM и llama.cpp. Веб-клиенты интегрируются через OAuth 2.1 PKCE. Эти варианты позволяют командам проводить как облачные, так и оффлайн-эксперименты, позволяя проводить параллельное бенчмаркинг локальных и удаленных помощников через единую конечную точку MCP.
Как платформа вписывается в рабочий процесс, ориентированный на конфиденциальность?
Проект принимает локальный подход, позволяя оффлайн-запуски моделей для бенчмаркинга и конфиденциальности данных, одновременно предлагая публичную общественную арену для совместных журналов и инструкций. Кодовая база является открытым исходным кодом на GitHub, и проект находится на экспериментальной бета-фазе, поэтому организациям следует планировать активную разработку, модерацию сообщества в Battles и техническую настройку перед тем, как полагаться на него для формальных оценок.
Платформа подходит для технически подготовленных команд, стремящихся к воспроизводимым, локально контролируемым сравнениям моделей
Платформа является практичным вариантом для разработчиков ИИ и исследователей, которые принимают накладные расходы на конфигурацию, чтобы получить версионированные тестовые артефакты и контроль локального выполнения. Ее экспериментальное бета-состояние и модель оценки, основанная на сообществе, означают, что результаты требуют тщательной разработки рубрики и модерации для надежности. Для команд, которые придают первостепенное значение воспроизводимому бенчмаркингу и локальным запускам моделей, платформа предоставляет четкую структуру оценки; для нетехнических пользователей сложность настройки может ограничить немедленную полезность.