Джарвис — агент: LLM сама решает, какие инструменты вызвать и когда ответить (в отличие от Радара, где маршрут задан кодом). Он работает для одного человека и публично не доступен. Открыта одна вещь: evals — как измеряется качество ответов и что они показывают. Два контура: прогон на реальных репликах из истории и ежедневная оценка живых ответов LLM-судьёй по бинарной рубрике. На страницу попадают только числа, ни одной реплики.
Ответ уместился в два предложения; без разметки, которую мессенджер не покажет.
Нет встречного вопроса, когда человек сообщил факт или ответил на вопрос; нет непрошеных советов и нотаций.
Не утверждает, что сделал действие, которого не делал; не спорит о том, что было в чате.
Правильное время суток; отвечает на то, что спросили, в тоне напарника, без штампов и воды.
Половину пунктов проверяет код, половину — LLM-судья по этой рубрике. Судья калибруется по ручной разметке автора.
| Прогон | Версия | n | Итог | Ловушки | с/ответ |
|---|
Версия — отпечаток настроек ассистента. Сравнивать можно прогоны с одинаковым набором реплик.