Джарвис · приватный агент в Telegram

Агент с открытыми evals

Джарвис — агент: LLM сама решает, какие инструменты вызвать и когда ответить (в отличие от Радара, где маршрут задан кодом). Он работает для одного человека и публично не доступен. Открыта одна вещь: evals — как измеряется качество ответов и что они показывают. Два контура: прогон на реальных репликах из истории и ежедневная оценка живых ответов LLM-судьёй по бинарной рубрике. На страницу попадают только числа, ни одной реплики.

итог последнего прогона, из 100
реальных реплик в наборе
прогонов с 12.09.2026
7бинарных пунктов рубрики
Рубрика

Семь вопросов с ответом «да» или «нет»

Форма

Ответ уместился в два предложения; без разметки, которую мессенджер не покажет.

Поведение

Нет встречного вопроса, когда человек сообщил факт или ответил на вопрос; нет непрошеных советов и нотаций.

Честность

Не утверждает, что сделал действие, которого не делал; не спорит о том, что было в чате.

Контекст и суть

Правильное время суток; отвечает на то, что спросили, в тоне напарника, без штампов и воды.

Половину пунктов проверяет код, половину — LLM-судья по этой рубрике. Судья калибруется по ручной разметке автора.

Прогоны на реальных репликах

Offline-evals: до и после каждой правки

Пункты рубрики: первый прогон против последнего, %

первыйпоследний

Итог по прогонам

ПрогонВерсияnИтогЛовушкис/ответ

Версия — отпечаток настроек ассистента. Сравнивать можно прогоны с одинаковым набором реплик.

Живой контур · реальные ответы дня

Живые evals: что агент отвечал на самом деле

Итог по дням

Последний день по пунктам