Постановка эксперимента
Хорошая постановка заранее отвечает на три вопроса: что проверяем, как проверяем и по какому результату принимаем решение.
Коротко: что делать
- Опишите исследовательское предположение в одном-двух предложениях.
-
Запустите
сценарий проектирования эксперимента
(
koi-grill-experiment): он задаст вопросы и соберёт черновик карточки. -
Запустите
сценарий проверки постановки
(
koi-report-review): три отдельные проверки оценят текст, полноту постановки и подзадачи. - Откройте карточку в очереди на доске задач. Исправьте неточности вручную или попросите помощника внести правки.
- Повторите не пройденные проверки. Только после этого берите карточку в работу.
1. Типовой цикл
Сначала дайте помощнику короткий черновик. Точную формулировку искать не нужно: сценарий задаст вопросы и поможет её уточнить.
Для метода <название> в проекте <название>
хочу проверить: <исследовательское предположение>.
Собери постановку с помощью koi-grill-experiment,
затем проверь её через koi-report-review.
Задавай по одному вопросу. Пока ничего не запускай.
После опроса прочитайте заголовок, описание и первые три раздела отчёта. Если что-то неверно, исправьте сами или напишите помощнику: «Исправь <что именно> и повтори не пройденные проверки».
2. Сценарии в помощь
| Сценарий | Что делает |
|---|---|
koi-grill-experiment |
Задаёт по одному вопросу и готовит карточку с первыми тремя разделами отчёта. Ничего не запускает. |
koi-report-review |
Отдельно проверяет ясность текста, полноту постановки и качество подзадач. После правок проверки повторяются. |
koi-prose-style |
Сокращает и проясняет заголовки, описания, узлы дерева и выводы. Полезен во всём проекте, а не только здесь. |
Как сценарий прозы улучшает текст
«Подход знаменует прорывной сдвиг в способности агента к обобщению».
«С моделью мира агент решил 12 сред вместо 8».
Перепиши заголовок и описание карточки
по koi-prose-style. Сохрани факты,
убери канцелярит и внутренний жаргон.
3. Эксперимент или задача
Эксперимент отвечает на исследовательский вопрос. Он может требовать изменения кода, но код здесь служит средством; основной результат — данные, таблицы, графики и вывод.
Инженерная задача меняет систему. Основной результат — код, а правильность подтверждают тесты.
| Эксперимент | Инженерная задача | |
|---|---|---|
| Цель | Проверить предположение. | Реализовать поведение. |
| Результат | Данные и вывод. | Код и тесты. |
| Готово | Выполнен протокол и вынесен вердикт. | Тесты подтверждают требования. |
Проверка предположения может включать и разработку, и эксперимент.
Иногда нужно сначала добавить новую возможность, а затем измерить её
эффект. На доске такую карточку можно пометить тегом разработки
(feature), эксперимента (experiment) или обоими
тегами.
Если реализацию и измерение эффекта можно завершить за одну небольшую итерацию, задайте отдельный критерий готовности для кода и для исследовательского вывода. Если реализация сама требует отдельной проверки, создайте две карточки: инженерную задачу, затем эксперимент.
Масштаб одной карточки
Одна карточка — одна итерация. Если эксперимент нельзя завершить одним вердиктом, а задачу — одним набором проверок, уменьшите объём.
SMART для одной карточки
| S | Конкретное действие. |
| M | Измеримый результат. |
| A | Ограниченный объём. |
| R | Связь с узлом дерева. |
| T | Порядок и зависимости. |
Это внутренняя проверка ResearcherOS, названная SMART. Здесь T означает порядок и зависимости, а не стандартный критерий SMART.
Чек-лист готовой постановки
- Понятно, какой результат должна дать карточка: код, исследовательский вывод или оба; для каждого результата задан свой критерий готовности.
- У эксперимента есть один основной измеряемый показатель и заранее заданное правило решения.
- У задачи указано требуемое поведение и тесты.
- Перечислены зависимости и то, что не входит в работу.
- Каждая подзадача даёт проверяемый результат.
- Заголовок короткий, детали находятся в описании и отчёте.
«Запустить эксперименты и посмотреть результаты».
«На 20 средах, не использованных при разработке, сравнить агента с моделью мира и без неё: выполнить по пять запусков для каждого условия, сохранить исходные показатели и заполнить итоговую таблицу».