Я представлял себе все неправильно?
Я не помню, что из этого есть в открытых источниках, поэтому могу ответить только заведомо менее детально, чем есть в общедоступной информации :)
Вообще по хорошему нужно сначала выбирать модель на основе каких-то других тестов, а потом публиковать сравнение только для финальной версии. Разумеется многие используют бенчмарки и для выбора версии. Но всё же что-то покрутить и перезапустить обучение с нуля, надеясь что бенчмарк будет пройден лучше - слишком дорого.
Как правило если есть какой-то бенчмарк, под который хотите оптимизироваться, то нужно сделать что-то похожее на этапе обучения. Собственно научить модель говорить "не знаю" можно на этапе RL довольно просто, и это в том или ином виде делается. Элементарно если мы учим модель двум вещам: 1) лучше сказать правду чем что-то кроме правды; 2) лучше сказать правду или "не знаю" чем неправду - то модель уже насколько-то научится говорить "не знаю".
Т.е. на идейном уровне, как и почти всё в LLM, всё просто. Вопрос, как это сделать, чтобы оно правда работало.
Не вполне понял при чем тут командная строка
Чтобы можно было смотреть файл по частям. Любые адекватные tools сойдут.