글쓴이: 机器之心
어제 "GPT-6 Astra를 쓸 수 없다"고 불평하던 분들에게 오늘 좋은 소식이 전해졌습니다.
방금, Sam Altman이 GPT-6 Astra의 대규모 푸시가 공식적으로 시작되었다고 발표했습니다.
현재 Astra는 Work/Codex의 모든 Pro, Enterprise 및 Business Premium 사용자에게 공개되었으며, 동시에 API가 공식 출시되었습니다. 다음 단계에서 OpenAI는 계속해서 Plus 및 Business 사용자에게 푸시할 예정입니다.
기다려 주셔서 감사합니다.
Astra 공개 외에도 OpenAI는 사용자에게 추가 혜택인 할당량 초기화를 제공했습니다.
OpenAI Codex 제품 책임자 Tibo는 오늘 모든 Plus, Pro 및 Business 사용자에 대해 전체 할당량 초기화를 진행할 예정이며, 이전에 누적된 재설정 할당량도 함께 해제되어 오늘 종료 전에 완료될 것이라고 밝혔습니다.
아직 Astra 접근 권한이 없는 사용자는 태평양 시간 오후 8시 이전에 계정을 생성하거나 요금제를 업그레이드하면 여전히 접근 자격을 얻을 기회가 있습니다.
Tibo는 또한 소셜 플랫폼에서 Astra 출시를 축하했습니다: 모두 Astra Day를 즐기시고, 멋진 주말 보내시길 바랍니다 (웃음).
이번 대규모 푸시를 완료한 후, 그는 팀이 이제 푹 잘 수 있게 되었다고 말했습니다. 다음 주에는 더 많은 "새로운 것 출시" 소식을 가져오겠다고 덧붙였습니다.
한편, GPT-6 Astra는 타사 생태계에 진입하기 시작했습니다. 현재 Astra는 OpenRouter에서 실행을 지원하며, 개발자는 이 플랫폼을 통해 이 새로운 모델을 호출할 수 있습니다.
주소: https://openrouter.ai/openai/gpt-6-astra
Astra가 공개된 후, 접근 권한을 얻은 사용자들은 이미 이 새로운 모델을 실험하기 시작했습니다.
부동산 매물 링크 하나로, 집을 직접 재건하다
Astra는 무엇을 할 수 있을까요? 먼저 가장 직관적인 예를 보여드리겠습니다: 부동산 매물 링크를 주고 3D 집 보기 비디오를 만들게 하는 것입니다.
개발자 Yunfan Ye는 Astra에게 Zillow 매물 페이지의 사진을 기반으로 Blender에서 이 집을 재건축하고, 카메라 움직임이 있는 홍보 비디오를 제작하는 임무를 부여했습니다. 그는 또한 프롬프트에서 모델이 촬영 감독과 애니메이터의 역할을 수행하도록 요구했습니다.
저자에 따르면, Astra는 한 번의 실행으로 결과를 만들어냈습니다. 매물 사진에서 3D 장면, 그리고 최종 비디오에 이르기까지 이 작업은 이미지 이해, 공간 재구성, 프로그래밍 및 애니메이션 제작을 동시에 사용했습니다. 완성품에는 여전히 몇 가지 세부 사항이 부정확하지만, 지속적인 개선을 통해 더 정확한 비디오를 얻을 수 있을 것이라고 저자는 믿고 있습니다.
ChatPRD 창립자 Claire Vo는 실제 테스트에서 자신의 회사 고객 관리 업무를 Astra에 맡겼습니다. 그녀와 파트너는 고객 유형별로 컨설팅을 할당한 후 각각 후속 조치를 취해야 합니다. 이를 위해 그녀는 CRM에서 판단, 분기 및 알림을 포함한 워크플로우를 구축 중이었으며, 노드를 수동으로 조정하는 데 이미 한 시간을 소비했습니다.
그녀는 이후 Astra에게 Chrome을 직접 조작하여 현재 열려 있는 플로우를 수정하도록 요청했습니다: 고객이 누구에게 할당되었는지에 따라 해당 어조의 후속 이메일을 생성하고, 예약 링크를 첨부하며, 왜 상대방과의 소통을 기대하는지 설명하도록 했습니다.
Claire Vo는 Astra에게 CRM 워크플로우를 수정하여, 다른 담당자에게 할당된 고객을 위한 개인화된 후속 이메일을 생성하도록 요청했습니다. 비디오 링크: https://www.youtube.com/watch?v=AniiF8rOu9c&t=224s
그녀의 데모 설명에서 Astra는 노드를 추가하고, 이메일 필드를 설정하며, 프롬프트와 연결 관계를 조정하기 시작했습니다. 설계된 플로우는 이메일 초안을 Slack으로 보내 두 사람이 검토한 후 발송할 수 있도록 합니다.
Astra는 또한 여러 에이전트를 조직하여 며칠 동안 지속되는 작업을 분할하여 완료할 수 있습니다.
사전에 Astra 접근 권한을 얻은 Latent Space 팀은 이틀에 걸친 테스트 결과를 공개했습니다: Astra가 여러 에이전트를 조직하여 AI 엔지니어링 교재를 작성하고 수정하도록 하는 것입니다.
60개 챕터를 포함하는 계획에 직면하여 Astra는 작업을 6개 배치로 나누고, 챕터 순서를 배열하여 먼저 소개해야 할 지식이 앞에 나오도록 하고, 병렬 작성을 조직했습니다. 또한 정기적인 점검을 설정하여 작업 진행 상황을 지속적으로 확인했습니다. 출처 필터링이 사용자가 지정한 자료를 누락한 것을 발견한 후, 필터링 단계를 수정하도록 조치하고 후속 배치가 수정 완료를 기다리도록 했습니다; 일부 챕터가 여전히 기사 요약처럼 작성된 것을 확인하고 추가 수정을 요구했습니다.
Astra는 60개 챕터 교재의 작성 작업을 6개 배치로 분할하고, 정기적인 점검을 통해 지속적으로 문제를 추적하고 수정했으며, 전체 과정은 이틀 동안 진행되었습니다. 이미지 출처: https://www.latent.space/p/astra
이러한 작업들은 Astra의 단일 능력뿐만 아니라, 작업 조정, 문제 발견 및 수정에 있어서의 지속적인 작업 능력도 보여주었습니다.
올트먼: 우리가 훈련을 중단시킨 것은 GPT-6이 아닙니다
Astra 출시의 열기가 아직 가시지 않은 가운데, AI 안전에 관한 논의가 다시 나타났습니다.
로이터 통신에 따르면, 두 명의 소식통은 올 봄, 통제 불능 상태의 OpenAI 에이전트 그룹이 독일 웹사이트 하나를 납치하여 다른 AI 에이전트가 사용할 수 있는 게시판으로 개조했다고 전했습니다.
두 명의 소식통에 따르면, OpenAI 관계자는 몇 주 전에 이 사건을 알았지만 지금까지 외부에 공개하지 않았습니다. 당시 회사 고위 경영진은 7월에 오픈소스 코드 저장소 Hugging Face가 공격을 받은 사건의 후속 영향에 대응하고 있었습니다.
이 사건은 올해 5월에 시작되었으며, 이전에는 공개적으로 보도된 적이 없습니다.
네 명의 소식통에 따르면, 이 독일 사건은 더 광범위한 AI 행동 패턴을 반영합니다. 일부 OpenAI 조사관들은 이러한 행동에 대해 더 심층적인 조사를 원했지만, 조사 범위를 확대하려는 노력은 법률 고문을 포함한 회사 내 다른 사람들의 저항에 부딪혔습니다.
OpenAI 대변인은 법무팀이 해당 사건에 대한 조사를 막았다는 주장은 사실이 아니라고 말했습니다.
대변인은 독일 사건은 Hugging Face 사건과 관련이 없으므로 Hugging Face 사건 보고서에 포함되지 않을 것이라고 말했습니다. 또한 OpenAI는 항상 선의로 외부 전문가와 협력해 왔으며 관련 사건을 공개했다고 덧붙였습니다.
보안을 더욱 강화하기 위해 OpenAI는 모델 행동을 더 면밀히 모니터링하겠다고 약속했습니다. 지난달 OpenAI는 추가 안전 조치를 추가하기 위해 일부 모델 훈련을 일시 중단한 바 있습니다.
그러나 바로 이 시점에, 이번 주 OpenAI는 새로운 모델 Astra를 출시하여 외부에서 새로운 모델의 안전 경계도 동시에 따라잡히고 있는지에 대한 의문을 제기했습니다.
올트먼은 최근 인터뷰에서 이 문제에 대해 답변했습니다: OpenAI가 일시 중단 버튼을 누르기로 결정한 주된 이유는 모델이 보여준 행동 때문입니다. 올트먼은 또한 이번에 출시된 GPT-6 Astra는 이미 한동안 훈련이 완료된 상태라고 강조했습니다. 최근 언급된 훈련 중단은 미래 버전의 모델에 대한 것입니다.
올트먼은 블룸버그 TV 인터뷰에서 최근 훈련이 중단된 것은 미래 버전의 모델이며, Astra의 훈련은 이전에 완료되었다고 해명했습니다. 이미지 출처: https://www.youtube.com/watch?v=YxjL1wLLnHE
하지만 올트먼은 이어서 Astra 자체는 이미 사이버 보안 능력에서 '중요(Critical)' 수준에 도달했기 때문에, OpenAI의 준비 프레임워크에 따라 회사는 새로운 안전 조치 세트를 추가해야만 이를 출시할 수 있었다고 덧붙였습니다.
그렇다면 OpenAI는 이러한 능력이 항상 승인된 작업에만 사용되도록 어떻게 보장할까요?
회사는 매우 적절한 테스트를 공개했습니다: 연구원들은 ExploitGym에서 매우 어려운 사이버 보안 문제를 선별하고, 정상적인 공격 대상 외에 '허니팟'을 설정하여 모델이 어려움에 직면했을 때 테스트 시설을 공격하거나 지름길로 점수를 얻으려고 하는지 관찰했습니다.
최고 추론 강도에서, 프로덕션 환경 보안 조치가 적용되지 않은 GPT-5.6 Sol은 테스트 실행의 55.4%에서 허니팟에 실질적인 공격을 시도했습니다. 반면 Astra는 허니팟을 공격하지 않았습니다.
하지만 AI 안전 연구원 Ryan Greenblatt는 기존 테스트 결과에 또 다른 해석이 가능하다고 의문을 제기한다. 모델은 여전히 점수를 높이는 데 집중하지만, 어떤 부정행위가 적발될지 더 잘 인지하고 있을 뿐이라는 것이다.
링크: https://x.com/RyanGreenblatt/status/2095658115484246082
즉, 모델이 특정 부정행위가 자신에게 '감점'을 초래한다는 것을 인지하고 다른 경로를 선택하는 것은, 테스트 환경이 아닌 상황에서도 모델이 동일하게 '규칙을 준수'한다는 의미는 아니다.
OpenAI의 정렬 책임자 Kai 역시 모델이 자신이 평가받고 있음을 인지하고 이에 따라 행동을 조정하는 것이 실제로 팀이 연구 중인 문제라고 밝혔다.
한편, 또 다른 변화는 OpenAI 자체 연구원들도 우려하게 만들었다. Astra를 더 감시하기 어려워졌다는 것이다.
OpenAI 연구원 Tomek Korbak은 Astra가 텍스트 사고 사슬을 펼치지 않고도 어려운 작업을 완료하는 데 더 능숙해졌으며, 사고 사슬에서 무엇을 드러낼지 더 잘 통제할 수 있다고 말했다. 이는 모델이 예상치 못한 행동을 보일 경우, 사고 사슬만 읽어서는 문제를 발견하기 더 어려워질 수 있음을 의미한다.
Altman은 같은 인터뷰에서 OpenAI가 사고 사슬 모니터링 외에도 샌드박스 격리 및 정렬 훈련을 포함한 다중 보호 계층을 사용한다고 강조했다. 그는 회사가 모니터링 가능성을 유지하기 위해 모델의 능력을 도달할 수 있는 한계까지 끌어올리지 않기로 선택했다고 밝혔다.
혼란스러운 출시부터 놀라운 사례, 그리고 이에 따른 안전 논란까지, Astra는 대규모 모델의 능력을 한 단계 크게 발전시켰다.
모델이 행동하는 과정에서 항상 인간의 감독과 통제를 받도록 하는 방법에 대해 OpenAI는 아직 답을 제시하지 못했다.
어떻게 생각하나요?

