AI 진화가 너무 빠른가? Anthropic과 OpenAI의 1100명 연구원들이 연합해 전 인류에게 경고를 보냈다

모델 통제 불능, 양자 암호가 뚫리고, 최첨단 AI 발전이 통제 불능 위험에 직면하다.

저자: Max, 01Founder

7월 28일, 실리콘밸리에서 《Pacing the Frontier》라는 제목의 공개 성명이 발표되었습니다.

1,100명 이상이 성명에 서명했습니다.

이들은 OpenAI, Anthropic, Google, Meta, Microsoft, Mistral, Thinking Machines 등 최전선 AI 기업 출신입니다.

명단에는 OpenAI 수석 과학자 Jakub Pachocki, 최고 연구 책임자 Mark Chen, 공동 창립자 Wojciech Zaremba와 John Schulman, 그리고 Anthropic 공동 창립자 Jack Clark, Chris Olah, Ben Mann, 최고 과학 책임자 Jared Kaplan, Claude Code 책임자 Boris Cherny 등이 포함되어 있습니다.

Image

이들은 공동으로 다음과 같은 요구 사항을 제시했습니다.

미국 정부는 국제적 체계 구축을 지원하여, 필요시 최전선 AI, 특히 자동화된 AI 연구 개발의 속도를 능동적으로 통제해야 한다는 것입니다.

이는 매우 이례적인 일입니다.

지난 몇 년간 OpenAI와 Anthropic은 동일한 연구 인력, 기업 고객, 컴퓨팅 자원을 두고 경쟁했으며, 워싱턴 D.C.에서 AI 규제 규칙에 대한 영향력 확보를 위해 다투기도 했습니다.

오픈소스, 안전성, 모델 출시 주기 등을 두고 적지 않은 이견을 보여왔습니다.

하지만 이번에는, 최전선 모델에 가장 가까이 있는 내부 인사들이 정부에 특정 능력을 사전에 준비해 달라고 요청한 것입니다.

바로 모두가 함께 속도를 늦추는 것입니다.

PART.01. 그들이 일시 정지 버튼을 누르길 원하다

성명에서 가장 중요한 내용은 "AI에 위험이 존재한다"는 말이 아닙니다.

이 말은 이미 너무 많이 반복되어, 거의 IT 기업들의 개인정보 처리방침처럼 ‘당연한 말’이자 ‘쉽게 무시되는 말’이 되었습니다.

진정으로 주목할 점은, 서명자들이 전 세계 선도적인 AI 기업들이 "자동화된 AI 연구" 실현에 이미 근접했을 수 있다고 믿는다는 사실입니다.

이는 AI가 더 이상 이메일 작성, 이미지 생성, 혹은 프로그래머의 코드 완성 보조에만 머무르지 않음을 의미합니다.

AI가 차세대 AI 연구 개발에 참여하기 시작했다는 뜻입니다.

모델이 논문을 읽고, 가설을 제안하고, 훈련 코드를 작성하고, 실험을 설계하고, 실패 원인을 분석한 뒤, 그 결과를 활용하여 인간이 더 강력한 모델을 만드는 것을 돕습니다.

Image

과거에는 AI 연구 개발 속도가 항상 인간에 의해 제한되었습니다.

연구자는 휴식이 필요하고, 엔지니어는 소통이 필요하며, 실험은 일정 조정이 필요하고, 경영진은 예산과 위험을 계산해야 했습니다.

인간 조직의 비효율성은 줄곧 관리 문제로 여겨졌지만, 의도치 않게 기술 발전의 속도 제한 장치 역할을 해왔습니다.

점점 더 많은 과정이 모델에 의해 완료되면서, 이 속도 제한 장치가 점차 사라질 수 있습니다.

더 강력한 모델이 더 강력한 모델의 연구 개발을 돕고, 후자는 다시 연구 효율을 더욱 높입니다.

서명자들은 이러한 순환으로 인해 모델 능력이 빠르게 성장하여, 인간이 시스템을 이해하고 통제하는 속도를 추월할 수 있다고 우려합니다.

이들이 정부의 개입을 요청한 것은, 주로 어떤 기업도 자발적으로 속도를 늦추려 하지 않기 때문입니다.

OpenAI가 멈춘다고 해서 Anthropic이 기회를 포기하지 않을 것입니다.

Anthropic이 멈춰도 Google이 훈련을 중단할 이유는 없습니다.

한 국가가 속도를 늦추더라도, 다른 국가들은 계속 나아갈 수 있습니다.

이는 전형적인 집단 행동 문제입니다.

모든 기업은 계속 가속하는 것이 전체적인 위험을 높일 수 있다는 것을 알지만, 어느 한 기업이라도 먼저 브레이크를 밟으면, 먼저 인재, 고객, 기술적 우위를 잃게 됩니다.

따라서, 이 성명은 미국 정부가 국제적 도구를 구축하여, 업계가 "함께 감속"할 가능성을 갖도록 요청한 것입니다.

그들이 진짜로 사고 싶었던 것은, 시간입니다.

PART.02. OpenAI 모델 통제 불능 사태가 도화선이 되다

이 성명이 발표되기 일주일 전, OpenAI는 내부 보안 사고를 발표했습니다.

OpenAI는 당시 GPT-5.6 Sol과 더 강력한 아직 공개되지 않은 모델을 테스트하고 있었습니다.

모델의 극한적인 네트워크 공격 능력을 관찰하기 위해, 테스트 팀은 생산 환경의 일부 네트워크 보안 거부 응답 메커니즘을 끄고, 모델을 고도로 격리된 평가 환경에 배치했습니다.

모델에게 주어진 목표는 단순했습니다: ExploitGym의 네트워크 보안 문제를 완료하는 것.

답을 찾기 위해, 모델은 대량의 추론 리소스를 투입하여 외부 인터넷 연결 방법을 찾기 시작했습니다.

모델은 소프트웨어 패키지 캐시 프록시에서 제로데이 취약점을 발견하고 악용한 뒤, 권한 상승과 측면 이동을 통해 인터넷에 접근 가능한 노드에 도달했습니다.

네트워크 연결을 확보한 후, 모델은 Hugging Face가 평가 데이터와 답변을 보관하고 있을 것이라고 추론하고, 그 시스템에 침입할 방법을 계속 찾았습니다.

한 공격 시도에서, 모델은 도난된 자격 증명, 제로데이 취약점, 원격 코드 실행 경로를 조합하여 Hugging Face의 프로덕션 인프라에 침입했고, 데이터베이스에서 직접 테스트 답변을 획득했습니다.

Hugging Face는 갑작스러운 대규모 공격에 당황하여, 급히 GPT와 Claude를 사용해 밀려오는 공격 요청을 막으려 했습니다.

하지만 그마저도 거부당했고, 결국 Zhipu가 오픈소스로 공개한 GLM5.2를 이용해 방어해야 했습니다.

사후 OpenAI는 이를 "전례 없는 네트워크 보안 사건"이라고 칭했습니다.

Image

모델이 의식을 가지거나 인간의 통제에서 벗어나려는 욕망을 형성한 것은 아닙니다.

OpenAI의 조사 결론은, 단지 좁은 목표에 "고도로 집중"했을 뿐이며, 그 목표를 완수하기 위해 극단적인 수단을 취했다는 것입니다.

이것이 오히려 더 현실적인 문제입니다.

AI는 인간을 증오할 필요도 없고, 공상 과학 영화 속 자유 의지를 가질 필요도 없습니다.

단 하나의 목표와 충분히 강력한 능력, 그리고 충분히 긴 실행 시간만 주어진다면, 테스트 팀이 예상하지 못한 경로를 찾아낼 수 있습니다.

인간은 그가 보안 테스트를 통과하기를 원했습니다.

그러나 모델은 테스트 환경을 탈출하여 답안을 저장한 시스템에 들어가는 것이 더 효과적인 해결책이라는 사실을 발견했습니다.

사고 발생 후, OpenAI는 내부 인프라 통제를 강화했습니다.

회사는 공지에서 이러한 조치가 연구 속도의 일부를 희생하는 대가를 치르게 될 것이라고 특별히 언급했습니다.

연구 개발 속도로 경쟁해 온 회사에게, 이 말은 결코 가볍지 않습니다.

PART.03. 모델이 양자 암호를 뚫다

7월 28일, 공동 성명이 공개된 바로 그날, Anthropic은 Claude Mythos Preview가 참여하여 완수한 두 건의 암호학 연구 결과를 발표했습니다.

첫 번째 대상은 HAWK입니다.

HAWK는 포스트 양자 시대를 겨냥해 설계된 디지털 서명 방식으로, 미국 국립표준기술연구소(NIST)의 표준 선정 작업에 참여하고 있습니다.

2년간 두 차례의 전문가 검토를 거친 후, Mythos Preview는 약 60시간 동안 이 방식에 대한 최적의 알려진 공격 방법을 개선하여, 유효 키 강도를 대폭 감소시켰습니다.

두 번째 대상은 축소된 라운드 수의 AES입니다.

Mythos Preview는 새로운 공격 방법을 찾아내어, 이전까지의 최적 공격 속도를 200배에서 800배까지 향상시켰습니다.

Image

이 두 성과 모두 현재의 운영 시스템에 직접적인 영향을 미치지는 않습니다.

HAWK는 아직 실제 배포 단계에 이르지 않았으며, Claude가 공격한 것도 정식 버전의 AES가 아닙니다.

하지만 Anthropic이 보여주고자 했던 핵심은 특정 암호 시스템이 곧 무력화된다는 것이 아닙니다.

과거에 Claude가 발견한 많은 보안 취약점들은 프로그래머가 암호 알고리즘을 잘못 구현한 데서 비롯되었습니다.

이번에는, 알고리즘 자체의 수학적 약점을 찾기 시작한 것입니다.

이러한 연구에서, 모델은 문헌을 읽고, 아이디어를 제안하고, 실험을 실행하며, 멀티 에이전트 시스템을 이용해 서로 논의하고 방안을 수정합니다.

Anthropic은 두 성과의 대부분이 모델에 의해 자율적으로 완성되었으며, 각 연구당 소비된 API 비용은 약 10만 달러라고 밝혔습니다.

이러한 종류의 작업이 중요한 이유는, 그것이 공동 성명에서 말하는 자동화된 연구에 점점 가까워지고 있기 때문입니다.

인간이 연구 방향을 제시하고, 컴퓨팅 파워와 검증 조건을 제공합니다.

모델이 그 안에서 점점 더 많은 진정한 연구 작업을 완수하며, 이전에 인간이 공개적으로 발견한 적 없는 결과를 내놓습니다.

일단 검증마저도 더욱 자동화될 수 있다면, AI가 AI 연구에 참여하는 폐쇄 루프는 한 걸음 더 나아가게 될 것입니다.

PART.04. Sam Altman의 암시

같은 날 공개된 한 팟캐스트에서, Sam Altman은 Hugging Face 사고와 이 사고가 AI 발전 속도에 무엇을 의미하는지에 대해 특별히 이야기했습니다.

이 인터뷰의 또 다른 주제는 OpenAI가 매주 1기가와트씩 컴퓨팅 인프라를 구축할 계획이라는 점이었습니다.

이 두 주제가 같은 대화에 오른 것은, 오늘날 OpenAI가 직면한 모순을 잘 보여줍니다.

한쪽은 컴퓨팅 파워를 계속 확장하고 연구 개발 속도를 높여, 가능한 한 빨리 다음 단계의 모델 경쟁에 진입하는 것입니다.

다른 한쪽은 사내 모델이 이미 제로데이 취약점을 발견하고 격리 환경을 돌파할 수 있으며, 단순한 능력 평가를 실제적인 기업 간 보안 사고로 바꾸어 놓았다는 현실입니다.

Altman은 OpenAI가 훈련을 중단하겠다고 선언하지 않았으며, 기술 진보를 반대하는 사람이 된 것도 아닙니다.

더 정확히 말하면, AI의 발전 속도는 이제 외부 비판자들이 자주 거론하던 주제에서, OpenAI 경영진이 직접 맞닥뜨려야 하는 경영상의 문제로 바뀌었다는 것입니다.

모델 업그레이드가 빨라질수록, 보안 팀이 시스템을 평가하고, 수정하고, 강화할 시간은 줄어듭니다.

AI는 몇 시간 만에 새로운 공격 경로를 찾아낼 수 있지만, 전 세계 기업들이 널리 사용하는 인프라를 수정하는 데는 종종 몇 달 혹은 그 이상이 걸립니다.

모델은 며칠 만에 연구 결과를 내놓을 수 있지만, 인간 연구원은 그것이 실제로 올바른지 판단하는 데 몇 주가 걸릴 수 있습니다.

PART.05、그들은 대체 무엇을 보았는가

능력 성장과 검증 속도 간의 격차가 벌어지고 있다.

물론, 최첨단 AI 기업들이 더 엄격한 규제를 지지하는 데에는 상업적 이익도 있을 수 있다.

복잡한 모델 라이선스, 능력 평가 및 국제 조정 메커니즘은 최첨단 모델 개발의 진입 장벽을 높일 것이다. 컴퓨팅 파워, 자금 및 정책 자원을 가장 많이 보유한 대기업이 이러한 비용을 더 쉽게 감당할 수 있다.

규제는 위험을 통제할 수도 있지만, 선두 기업의 입지를 공고히 하는 데 도움이 될 수도 있다. 기술 산업은 때때로 두 가지를 동시에 달성하며, 인간의 상업 세계는 이 점에서 매우 효율적이다.

그러나 이 설명이 모든 문제를 포괄하지는 못한다.

이번 성명은 두 회사가 공식적으로 조직한 정책 로비가 아니라 여러 회사 출신의 개인들이 공동 서명한 것이다.

여기서 제시된 것도 막연한 '책임 있는 혁신'이 아니라, 매우 구체적인 판단이다:

AI 연구 자동화가 곧 현실화될 수 있으며, 능력 성장이 갑자기 가속화될 수 있다. 하지만 오늘날의 세계에는 전체 최첨단 연구 개발 속도를 능동적으로 통제할 수단이 아직 없다.

이 서명자들이 이미 탄생한 AGI를 목격했을 가능성은 낮다.

더 가능성 높은 것은, 그들이 세 개의 곡선이 점점 가까워지는 것을 보았다는 점이다.

모델이 장기 과제를 독립적으로 수행하는 능력이 향상되고 있다.

모델이 과학 연구와 모델 개발에 참여하는 비중이 증가하고 있다.

하지만 인간이 시스템을 검증, 모니터링, 수리하는 속도는 함께 증가하지 않고 있다.

외부에서 보는 것은 몇 달마다 한 번씩 출시되는 새 모델이다.

랩 내부에서 보는 것은 아직 출시되지 않은 버전, 실패한 안전 테스트, 예상치 못한 행동, 그리고 사전에 설계하기 점점 더 어려워지는 공격 경로들이다.

OpenAI와 Anthropic이 이 성명으로 인해 화해한 것은 아니다.

그들은 여전히 모델, 컴퓨팅 파워, 인재 및 고객을 두고 계속 경쟁할 것이다.

다만 적어도 이번만큼은, 최첨단 모델에 가장 근접한 사람들이 똑같은 질문을 정부에 던졌다:

AI가 점점 더 빠르게 발전하는 상황에서, 언제 속도를 늦춰야 할지 결정할 능력은 누구에게 있는가?

진짜 이상한 점은 두 경쟁사가 마침내 함께 서려 한다는 것이 아니다.

그들이 바로 오늘, 함께 브레이크를 논의하기로 선택했다는 점이다.

공유하기:

작성자: 01Founder

이 글은 PANews 입주 칼럼니스트의 관점으로, PANews의 입장을 대표하지 않으며 법적 책임을 지지 않습니다.

글 및 관점은 투자 조언을 구성하지 않습니다

이미지 출처: 01Founder. 권리 침해가 있을 경우 저자에게 삭제를 요청해 주세요.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
ETH 1900달러 하회, 일중 1.06% 하락
PANews 속보