2026년 9월 6일 · 안전 / 연구
저자: Jakub Pachocki, OpenAI 최고 과학자
2023년 중반, "RLSlow" 연구 프로젝트에서 우리는 추론 모델의 학습을 확장할 수 있으리라는 확신을 준 첫 결과를 보았습니다. 사전학습된 모델이 스스로 사고 사슬(chain of thought)을 형성하는 능력을 열어주는 결과였습니다. 그날 밤 Szymon과 저는 사무실에서 밤을 지새웠는데, 이 기술이 가져다줄 놀라운 벤치마크 수치나 제품, 과학적 성과를 생각한 것이 아니었습니다. 우리 생애 안에 우리 자신보다 유의미하게 더 똑똑한 기계를 실제로 보게 되리라는 냉정한 사실을 소화하려 애쓰고 있었고, 그 시스템의 윤곽이 이미 눈앞에 보인다는 것, 그리고 이 사실의 중대함을 사람들에게 어떻게 알릴 것인가를 고민하고 있었습니다.
3년이 지난 지금, 추론 언어 모델은 경제에서 빠르게 비중을 키워가고 있고 과학의 경계를 밀어붙이기 시작했습니다. 이 모델들은 컴퓨터와 그래픽 인터페이스를 조작할 수 있고, 사람 및 서로와 협업하며, 연구 프로젝트를 수행할 수 있습니다. 또한 컴퓨터 보안의 지형을 바꾸어 놓고 있으며, 그 과정에서 명백히 새로운 위험을 제기하고 있습니다.
이 기간 동안 많은 새로운 연구가 이루어졌고, 이 시스템에 대한 우리의 이해도 2023년과는 또 조금 달라졌습니다. 내부 결과에 근거해, 저는 이 진보의 속도가 재귀적 자기개선(RSI)으로까지 이어질 수 있다고 강하게 예상합니다. AI 개발이 현재의 궤적을 계속 따라간다면, 앞으로 몇 년 안에 보게 될 시스템들은 지금까지와 같거나 더 큰 규모의 능력 도약을 다시 보여줄 가능성이 높고, 점점 더 스스로 자신의 개발을 주도하게 될 것입니다.
지금은 극도의 신중함이 요구되는 시기입니다. 저는 기계 지능의 급격한 상승이 계속될 때 그 결과에 대해 누구도 준비되어 있지 않다는 점을 우려합니다. OpenAI는 정렬(alignment)과 모니터링에 대한 기술적 해법을 계속 모색하고, 방어 시스템을 구축하며, 필요하다면 일방적으로 추가 스케일링을 보류할 것입니다. 다만 저는 그보다 더 폭넓은 개입이 필요하다고 믿습니다.
큰 틀에서 기계 지능의 진보는 연산 능력의 증가가 이끌어 왔습니다. OpenAI는 2017년경, 여러 연구 프로젝트에서 스케일링이 일관된 성과를 낸다는 것을 확인한 뒤 이 사실을 깊이 내면화했습니다.¹ 그 결과 우리는 원래 계획했던 것보다 훨씬 많은 연산 자원을 확보하려 했고, 연구를 확장성이 매우 높은 소수의 방향으로 점점 더 집중시켰습니다. 그것이 우리가 AI 연구의 최전선에 서서 AGI의 영향에 개입할 수 있는 유일한 길이라고 믿었습니다.
그 과정에서 개발된 새로운 알고리즘들, 팀과 개인 연구자들의 독창적인 성취들도 있었습니다. 하지만 저는 그것들을 대체로 스케일링이라는 경로 위에서 이루어진 발견으로 봅니다. 딥러닝의 과학은 아직 초기 단계이고, 유의미한 알고리즘적 진보는 연산 자원에 대한 접근성과 상관관계를 갖는 경향이 있습니다. 여러 해 단위로 시야를 넓혀 보면, AI는 더 큰 컴퓨터로 확장되면서 계속 더 지능적이 되고 있습니다.
그리고 20세기 말 Ray Kurzweil이 내놓았던 예측과 일치하게, 우리는 지금 기계 지능이 인간의 지능을 변혁적인 방식으로 넘어서기 시작하는 컴퓨팅 역사의 한 시점에 서 있습니다.
AI는 설계된다기보다 길러집니다. 일차적으로 AI는 상상하기 어려운 규모의 연산 위에서 단순한 최적화 단계를 수없이 반복한 산물입니다. 그 결과로 만들어지는 것은 추상적 개념을 통해 작동하고 인간 행동의 여러 측면을 모사할 수 있는, 믿을 수 없을 만큼 복잡한 시스템입니다. 우리는 신경과학과 비슷한 과정을 통해 이 시스템 안에서 창발하는 작은 메커니즘들에 대한 여러 통찰을 발견할 수 있습니다. 그리고 신경과학과 마찬가지로, 그 전체적인 작동은 우리가 온전히 이해할 수 있는 기술(description)을 벗어나 있습니다.
딥러닝 기반 AI 연구는 대체로 실험 과학입니다. 우리는 원리에 기반한 알고리즘을 만들고 검증 가능한 예측을 세우는 데 많은 노력을 쏟지만, 근본적으로 대규모 학습 실행은 실험이며 그 결과에 놀라는 일도 있습니다. 게다가 시스템이 유능해질수록 결과를 해석하기는 더 어려워집니다.
현재의 알고리즘이 측정하기 쉬운 능력을 객관적으로 정량화하기 어려운 능력보다 빠르게 향상시킨다는 점이 이를 더 복잡하게 만듭니다. 우리는 능력이 어떻게 일반화되는지, 앞으로 몇 년간 가장 중요해질 역량을 키우기 위해 무엇을 우선해야 하는지를 이해하는 데 많은 시간을 씁니다. 예를 들어 우리는 집중적으로 노력하면 모델을 수학 연구에 특히 능하게 만들 수 있다고 보지만, 뒤에서 논의할 RSI와 자동화된 정렬 연구에 대한 절박함 때문에 그 방향을 우선순위에 두지 않고 있습니다.
딥러닝 스케일링이 만들어내는 지능은 인간의 지능과 직접 비교할 수 있는 것이 아닙니다. 현실 세계에서 매우 중요해지려면 — 매우 유용하거나 매우 위험해지려면 — AI가 모든 인간 능력을 따라잡거나 능가할 필요는 없습니다. 충분히 많은 능력에서 앞서기만 하면 됩니다. 그리고 점점 더 많은 축에서 인간을 넘어서면서, 그것이 정확히 얼마나 유능한지를 파악하기는 점점 더 어려워지고 있습니다.
기계 지능은 인간 지능과 근본적으로 다른 과정에서 나오기 때문에, 그것이 기본적으로 인간의 원칙을 따르리라거나 인간과 비슷한 방식으로 그 원칙에서 일반화하리라고 가정할 수 없습니다. AI 연구의 핵심 문제는 정렬(alignment), 즉 AI가 인간의 기준에서 "옳은 일을 하려 하도록" 만드는 것입니다.
실질적인 연구 방향을 정리하는 목적에서, 저는 목표 정렬과 가치 정렬을 구분하는 것이 유용하다고 봅니다.
목표 정렬(goal alignment) 은 넓게 말해 "AI가 자신에게 주어진 목표를 달성하려 하는가?"입니다. 여기에는 지시 위계(instruction hierarchy)의 준수, 또는 사람과 소통하고 협업하며 그들의 목적을 이해하려 시도하는 능력 같은 것들이 포함됩니다. 이 방향은 실무적으로 대단히 중요했습니다.