추론 시간의 발견 — 오래 생각하는 모델이 이기는 이유
지난 금요 세션에서 다룬 주제를 정리합니다. 요즘 모델들은 파라미터를 늘리는 대신 답하기 전에 더 오래 생각하는 쪽으로 진화하고 있어요. 같은 모델이라도 추론 단계에서 토큰을 더 쓰게 하면 수학·코딩 성능이 눈에 띄게 오릅니다.
핵심은 간단합니다. 학습 시점의 스케일링은 이미 비싸졌고, 추론 시점의 스케일링은 아직 쌉니다. 문제 난이도에 따라 생각의 길이를 조절하는 것 — 이게 지금 가장 뜨거운 설계 문제입니다.
다음 세션에서는 이걸 온디바이스에서 어떻게 감당할지 이야기해 보려고 해요. 작은 모델이 오래 생각하는 것과 큰 모델이 짧게 생각하는 것, 어느 쪽이 이길까요?
댓글
3
안예준
ㅋㅋ

안예준
ㅋㅋ

안예준
ㅋㅋ
댓글은 멤버만 남길 수 있어요. 가입하기