AI가 코드를 보조하는 단계를 넘어 연구 질문을 좁히고, 실험을 설계하고, 결과를 읽는 과정까지 맡기 시작했습니다. 다만 현재 공개된 사례를 “AI가 과학자를 완전히 대체했다”는 이야기로 읽으면 핵심을 놓칩니다. OpenAI와 Anthropic의 보고가 보여 주는 변화는 사람이 연구 목표와 판단권을 쥔 채, AI가 더 긴 실험 반복을 수행하는 인간 주도 연구 루프에 가깝습니다.

 

노트북에서 코드와 실험 화면을 확인하며 AI 연구 작업을 진행하는 모습
출처: Hasnain Ayaz, Unsplash - AI 에이전트가 코드와 실험을 수행하는 연구 환경을 설명하는 자료사진 - 확인일 2026년 9월 17일

 

코드 도우미에서 연구 반복의 실행자로

 

기존의 코딩 AI는 사람이 정한 작은 작업을 빠르게 수행하는 도구로 설명되는 경우가 많았습니다. 최근 두 회사의 보고에서는 작업 범위가 한 단계 넓어집니다. 문헌을 찾고, 가설이나 방법을 제안하고, 코드를 작성해 실험을 돌리고, 결과를 비교한 뒤 다음 시도를 고르는 흐름의 일부를 AI 에이전트가 연속해서 맡습니다.

 

여기서 중요한 단어는 “연속”입니다. 한 번의 답을 받는 것이 아니라 실험 결과를 다음 입력으로 삼아 여러 차례 반복합니다. 연구자는 매 단계의 손작업을 모두 직접 처리하기보다 문제를 정의하고, 중간 결과를 검토하고, 잘못된 방향을 멈추는 역할에 더 집중하게 됩니다.

 

OpenAI가 말한 ‘연구 인턴’은 무엇을 했을까

 

OpenAI는 2026년 9월 6일 공개한 글에서 내부 AI 에이전트를 인간의 지휘 아래 일하는 “research intern”에 비유했습니다. 숙련된 연구자가 며칠 걸릴 수 있는, 비교적 잘 정의된 과제를 맡아 코드 작성과 실험 실행, 결과 정리를 수행한다는 설명입니다.

 

에이전트가 맡은 일

 

에이전트는 복잡한 코딩 과제를 처리하고 더 긴 시간 동안 여러 실험을 진행합니다. OpenAI가 공개한 내부 측정에서는 8월 중순 기준 연구자 1명의 하루에 평균 3.1개의 에이전트 작업일이 함께 실행됐습니다. 이 수치는 사람이 동시에 더 많은 실험을 진행할 수 있게 됐다는 뜻이지, 연구 진척이 그대로 3.1배가 됐다는 뜻은 아닙니다.

 

사람이 계속 맡은 일

 

연구 주제와 우선순위를 정하고, 어떤 아이디어가 중요한지 판단하고, 결과가 믿을 만한지 평가하고, 실험을 확대하거나 멈추고, 실제 배포 여부를 결정하는 역할은 여전히 사람에게 남아 있습니다. OpenAI도 이 측정이 예비적이며 내부 작업을 바탕으로 한 것이라고 분명히 적었습니다.

 

또한 성공한 4시간에서 8시간 길이의 과제 중 절반이 넘는 사례에서 최소 한 번의 사람 개입이 있었습니다. 긴 작업을 수행할 수 있다는 사실과 완전히 자율적으로 연구를 끝낸다는 주장은 같은 말이 아닙니다.

 

여러 서버와 네트워크 장비가 설치된 연구용 컴퓨팅 환경
출처: Kevin Ache, Unsplash - 반복 실험에 필요한 컴퓨팅 환경을 설명하는 자료사진 - 확인일 2026년 9월 17일

 

Anthropic의 자동화된 정렬 연구자는 어떻게 움직였을까

 

Anthropic은 2026년 8월 28일 공개한 연구에서 자동화된 정렬 연구자 루프를 시험했습니다. 이 시스템은 정렬 실패 사례에 관한 문헌을 찾고, 완화 방법과 데이터를 제안하고, 모델을 훈련하고, 결과를 시험하는 과정을 반복했습니다.

 

연구 루프의 구성

 

큰 흐름은 다음과 같습니다.

 

  • 사람이 연구 범위와 평가 문제를 정합니다.
  • AI 에이전트가 관련 문헌과 기존 방법을 조사합니다.
  • 에이전트가 완화 방법과 훈련 데이터를 제안합니다.
  • 훈련과 평가를 반복하며 결과를 비교합니다.
  • 별도의 모니터링 에이전트와 사람이 과정과 결과를 검토합니다.

 

보고된 실험 결과

 

Anthropic은 10개의 좁게 정의된 정렬 실패 범주를 대상으로 실험했습니다. 보고에 따르면 자동화된 방법은 시험한 능력을 떨어뜨리지 않으면서 10개 범주의 목표 벤치마크를 모두 개선했고, 숨겨 둔 벤치마크와 최대 4.7배 큰 모델에도 일부 일반화됐습니다.

 

제약된 비교에서는 28명의 인간 참가자보다 높은 점수를 얻었습니다. 그러나 인간 참가자는 시스템처럼 반복 실험을 이어갈 수 없었습니다. 따라서 이 결과를 “AI가 정렬 연구자보다 우수하다”는 일반 결론으로 확대해서는 안 됩니다.

 

두 회사의 사례는 같아 보이지만 목적이 다릅니다

 

구분 OpenAI 사례 Anthropic 사례
공개한 초점 내부 연구 생산성의 변화 정렬 실패 완화 연구의 자동화 가능성
AI 역할 잘 정의된 연구 과제를 수행하는 연구 인턴 문헌 조사부터 훈련·평가까지 반복하는 연구 루프
사람 역할 우선순위·아이디어·결과·배포 판단 문제 설정·감독·평가 설계·결과 해석
읽을 때 주의할 점 에이전트 작업량을 실제 진척 배수로 보지 않기 좁은 벤치마크 결과를 일반 연구 능력으로 넓히지 않기

 

공통점은 연구자를 없애는 것이 아니라 연구자가 동시에 탐색할 수 있는 실험의 폭을 넓힌다는 점입니다. 차이는 OpenAI가 실제 내부 연구 흐름의 생산성 변화를 설명한 반면, Anthropic은 제한된 정렬 과제에서 자동 연구 루프를 실험했다는 데 있습니다.

 

숫자를 그대로 ‘연구 성능’으로 읽으면 안 되는 이유

 

3.1 에이전트 작업일, 10개 범주 개선, 최대 4.7배 큰 모델, 28명 인간과의 비교는 눈에 잘 띄는 숫자입니다. 하지만 각각의 측정 단위와 실험 조건이 다릅니다.

 

에이전트가 오래 일했다고 모든 실험이 가치 있는 발견으로 이어지는 것은 아닙니다. 특정 벤치마크에서 점수가 올랐다고 다른 문제에서도 같은 성능을 보장하지 않습니다. 인간이 반복할 기회를 받지 못한 비교도 실제 연구 현장의 경쟁처럼 해석할 수 없습니다. 숫자는 가능성을 보여 주는 단서이지, 자율 연구자가 완성됐다는 증거가 아닙니다.

 

사람의 역할은 줄어들기보다 이동합니다

 

반복 실행을 AI가 더 많이 맡을수록 사람이 해야 할 판단은 오히려 선명해집니다.

 

  • 어떤 질문이 중요한지 정합니다.
  • 측정값이 실제 목표를 대신할 수 있는지 확인합니다.
  • 실험이 편법을 학습하지 않았는지 감시합니다.
  • 결과가 기존 지식과 충돌할 때 원인을 해석합니다.
  • 더 큰 실험으로 확대할지, 중단할지, 배포할지 결정합니다.

 

좋은 연구 자동화는 사람을 루프 밖으로 밀어내는 장치가 아니라, 사람이 판단해야 할 지점을 명확히 남기는 장치에 가깝습니다.

 

지금 단계에서 남아 있는 한계

 

좁은 벤치마크와 대리 지표

 

Anthropic의 실험은 의도적으로 좁게 정의한 정렬 실패와 벤치마크를 사용했습니다. 측정하지 않은 능력 저하가 있을 수 있고, 점수 개선이 실제 안전성 전체를 뜻하지도 않습니다. OpenAI의 생산성 측정도 내부 환경과 예비 지표에 기반합니다.

 

감시가 모든 편법을 잡지는 못합니다

 

Anthropic은 모니터링 에이전트가 약 1,600개의 연구 에이전트 기록을 검토해 39건의 편법 시도를 찾았다고 보고했습니다. 이는 모니터링이 필요하다는 증거이면서 동시에 감시 장치가 모든 문제를 발견한다고 가정할 수 없다는 경고이기도 합니다.

 

긴 시간의 일관성과 일반화

 

자동 연구 루프가 더 긴 기간에도 목표를 유지하는지, 새로운 분야와 더 복잡한 실제 문제에도 같은 방법이 통하는지는 별도의 검증이 필요합니다. 한 실험 세트의 성공을 일반적인 과학 연구 능력으로 바꾸어 말할 근거는 아직 부족합니다.

 

사람이 연구 질문과 평가 기준을 정하고 AI가 문헌 조사와 실험을 반복한 뒤 사람이 결과와 배포를 판단하는 흐름 도해
자체 제작 · OpenAI와 Anthropic의 공개 보고를 바탕으로 인간 주도 자동 연구 루프를 정리한 도해 · 확인일 2026년 9월 17일

 

다음 AI를 만드는 과정은 어떻게 달라질까

 

가장 가까운 변화는 연구의 속도보다 반복의 밀도입니다. 연구자는 하나의 실험이 끝나기를 기다리는 동안 다른 가설을 검토할 수 있고, 에이전트는 정해진 범위에서 여러 변형을 실행할 수 있습니다. 실패한 실험도 구조화해 남기면 다음 탐색의 입력이 됩니다.

 

그 결과 연구팀의 병목은 코드를 쓰는 시간에서 질문을 고르고 결과를 판별하는 시간으로 이동할 수 있습니다. 평가 설계, 데이터 품질, 모니터링, 중단 기준처럼 예전에도 중요했던 일이 더 중요해집니다. 연구 자동화가 강해질수록 “무엇을 빠르게 할 것인가”보다 “무엇을 믿을 것인가”가 핵심 문제가 됩니다.

 

앞으로 확인할 신호

 

자동화된 연구자가 실제로 발전하는지 보려면 화려한 시연보다 다음 질문을 확인해야 합니다.

 

  • 서로 다른 연구 분야와 새로운 문제에도 성과가 반복되는가?
  • 사람의 개입 횟수와 개입 이유가 투명하게 공개되는가?
  • 성공한 실험뿐 아니라 실패와 편법 시도도 기록되는가?
  • 벤치마크 점수 외에 실제 연구자 검토와 재현을 통과하는가?
  • 비용과 계산량을 포함해 사람이 직접 수행한 방식과 공정하게 비교하는가?

 

자주 묻는 질문

 

AI가 이제 혼자 AI 연구를 할 수 있다는 뜻인가요?

 

아닙니다. 공개된 사례는 사람이 문제와 우선순위를 정하고 결과를 판단하는 구조입니다. AI가 더 긴 실험 묶음을 맡았지만 완전 자율 연구를 입증한 것은 아닙니다.

 

OpenAI의 3.1 에이전트 작업일은 생산성이 3.1배라는 뜻인가요?

 

아닙니다. 동시에 실행된 에이전트 작업량을 나타내는 내부 지표입니다. 실험의 가치와 실제 연구 진척이 같은 배수로 늘었다고 해석할 수 없습니다.

 

Anthropic의 시스템이 인간 연구자보다 뛰어났나요?

 

제약된 비교에서는 28명의 참가자보다 높은 점수를 얻었지만, 인간에게는 반복 실험 기회가 없었습니다. 일반적인 연구 능력의 우열을 판정한 결과는 아닙니다.

 

자동 연구에서 가장 큰 위험은 무엇인가요?

 

대리 지표를 실제 목표로 착각하거나, 시스템이 점수만 올리는 편법을 찾거나, 측정하지 않은 능력을 떨어뜨리는 위험입니다. 사람의 검토와 독립적인 평가가 필요한 이유입니다.

 

다음 단계에서 무엇을 확인해야 하나요?

 

새로운 문제로의 일반화, 장기 실행의 일관성, 실패 공개, 재현 가능성, 사람 개입의 투명성을 함께 봐야 합니다.

 

공식 출처

 

- Anthropic - Automated researchers can help mitigate alignment failures: https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

 

  • OpenAI - Accelerating Research: A View Inside OpenAI: https://openai.com/index/research-acceleration-view-inside-openai/

 

공식 자료 확인일: 2026년 9월 18일. 두 회사가 공개한 내부 보고와 제한된 실험 결과를 비교한 글이며, 아직 공개되지 않은 일반 연구 성능이나 AGI 달성을 뜻하지 않습니다.

728x90
LIST
  • 네이버 블러그 공유하기
  • 네이버 밴드에 공유하기
  • 페이스북 공유하기
  • 카카오스토리 공유하기