운영중인 시스템은 누가 더 나아졌다고 판단할 수 있을까요? 담당자가 바뀌면 같은 에러도 다른 분석이 나오는 문제는 어떻게 해결할까요?최근 안드레 카파시가 공개한 Auto Research를 보면서, 최근 업무에서 비슷한 질문을 풀었던 경험이 떠올랐습니다. Auto Research가 하는 일Auto Research는 안드레 카파시가 공개한 오픈소스 프로젝트입니다. AI 에이전트가 사람 없이도 스스로 모델을 개선하도록 만든 자동 실험 루프입니다.동작 방식은 이렇습니다.개발자가 퇴근 전에 에이전트에게 지시를 내려둡니다에이전트는 `train.py` 파일 하나만 수정할 수 있습니다수정한 코드로 정확히 5분 동안 모델을 학습시킵니다학습이 끝나면 `val_bpb`(validation bits per byte)라는 지표..