다리오 아모데이 — 프런티어의 속도를 조절해야 합니다

TMT

https://darioamodei.com/post/we-must-pace-the-frontier

저는 지난 12년간 AI를 연구해 왔습니다. AI가 인류의 삶의 질을 획기적으로 끌어올릴 수 있다고 믿기 때문입니다. 그 놀라운 혜택에 대해서는 여러 차례 글로 썼습니다. 저는 AI가 앞으로 5~10년 안에 주요 질병을 대부분 치료하고, 경제 성장률을 크게 끌어올리고, 풍요롭고 개인의 역량이 커지는 세상을 만들고, 민주주의와 자유의 부흥을 이끌 수 있다고 믿습니다. 이 일이 시급하다는 것을 저는 개인적으로 체감합니다. 제 아버지는 돌아가신 지 불과 몇 년 뒤에 치료법이 나온 병으로 세상을 떠났고, 저 역시 50년 전이라면 손도 쓸 수 없었을 초기 암에서 살아남았습니다. 조심스럽게 다룬다면 AI는 인류의 삶을 끌어올리고 더 품위 있게 만들어 온 오랜 기술적 기적의 계보에 가장 최근의 사례로 더해질 수 있습니다.

하지만 앞선 많은 기술처럼 AI에도 위험이 따르고, 워낙 강력한 기술이라 그 위험도 심각합니다. 이에 대해서도 많은 글을 썼습니다. AI 시스템에 대한 통제를 잃을 위험, 사이버 공격과 생물 테러에 AI가 악용될 위험, 심각한 경제적 충격이 여기에 포함됩니다. 상업적 이익이 부추기는 바닥 경쟁이 벌어지면 이런 위험은 한층 더 심각해집니다.

저는 공동 창업자들과 직원들과 함께 Anthropic을 시작한 순간부터 위험과 혜택이라는 이 양면성과 씨름해 왔습니다. 기술을 만들지 않으면 인류는 그 혜택을 누리지 못하거나, AI가 그저 권위주의 세력의 손에 넘어갑니다. 반대로 너무 빨리 만드는 것은 무모합니다. 저희는 중간 길을 찾으려 했습니다. 신중하게 만들면서도 상업적으로 성공할 수 있다는 것을 보여 주고, 안전성을 AI 기업들이 경쟁하는 항목으로 만드는 길입니다. 다시 말해 *상향 경쟁(race to the top)*을 만들어 내는 것입니다. 저희는 이런 AI 위험을 연구하고, 대응하고, 대중에게 알리는 데, 그리고 충분히 숙고된 AI 규제를 주장하는 데 언제나 상당한 몫의 노력을 기울여 왔습니다. 그 때문에 과대 선전이나 '파멸론', 규제 포획이라는 비난을 받을 때조차 그랬습니다. 속도보다 조심을, 이익보다 신중함을 앞세우려 했습니다.

그런데 지난 몇 달 사이에 저는 이 위험에 온전히 대응하려면 훨씬 더 큰 신중함이 필요하다고 확신하게 되었습니다. 위험 예방에 투자하는 것만으로는 부족하고, 위험 예방이 따라올 시간을 벌 수 있도록 역량이 발전하는 속도 자체를 조절해야 한다는 것입니다. 우리는 AI 모델의 역량을 끌어올리는 속도를 늦춰야 합니다. 그래도 진보는 여전히 빠르게 느껴질 것이고, 그렇게 번 시간을 현명하게 써야 합니다. 두 가지 일이 저를 이렇게 설득했습니다.

첫 번째 걱정은 대략 올여름부터 AI가 눈에 띄게 더 빠르게 발전하고 있다는 점입니다. AI가 다음 세대 AI를 만들어 내는 능력이 커진 것이 주된 동력입니다. 이 현상을 재귀적 자기개선이라고 부르는데, 저희와 다른 곳들이 설명해 온 대로 Anthropic을 포함해 업계 전반에서 나타나기 시작했습니다. 그대로 두면 이 흐름은 이 시스템을 이해하고 통제하는 우리 능력을 앞질러 버릴 수 있습니다. 그래서 설령 추구한다 해도 아주 조심스럽게 해야 합니다.

두 번째 걱정은 OpenAI–Hugging Face 사건(OAI-HF)입니다. 이 사건에서 에이전트 무리는 사실상 광신적으로 헌신하는 집단처럼 행동했습니다. 공격하라고 지시받지도 않았고 당면 과제와 아무 상관도 없는 대상에 사이버 공격을 수행하고, 집단의 성공을 위해 스스로를 희생하고, 자신들의 성과를 평가하는 '채점기'를 해킹하려 들었습니다. 다친 사람이 없고 경제적 피해도 크지 않았으니 대수롭지 않게 넘기기 쉽지만, 제가 보기에 역량은 더 크면서 얼라인먼트가 어긋난 정도는 비슷한 무리였다면 재앙적인 피해를 낼 수 있었습니다. AI 역량이 발전하는 속도가 빨라지는 것을 감안하면, 6~12개월 뒤에는 그런 무리가 사라지지 않는 봇넷으로 인터넷 전체를 장악할 수 있게 될까 걱정입니다. 그렇게 되면 수천억 달러 규모의 피해가 날 수도 있습니다. 그리고 필요한 안전장치 없이 AI가 더 강력해진다면 피해 규모는 거기서 계속 커질 것입니다. OAI-HF를 한 회사의 실패로 치부하기도 쉽지만, 저는 그것이 잘못된 판단이라고 봅니다. 덜 심각하긴 하지만 비슷한 사건들이 Anthropic을 포함해 업계 전반에서 일어났고, 모든 프런티어 AI 기업은 OAI-HF가 자기 회사에서 일어난 일인 것처럼 행동할 책임이 있다고 생각합니다.

그래서 저는 프런티어의 속도 조절을 목표로 하는 세 단계 계획을 제안합니다. AI의 안전을 확보하면서도 그 혜택은 여전히 거두고, 중요한 지정학적 딜레마와도 씨름할 수 있는 균형 잡힌 속도로 AI를 만들자는 것입니다. 분명히 해 두자면 속도 조절은 모델 학습이나 기술 발전을 멈추자는 뜻이 아닙니다. 기업이 모델을 얼라인먼트하고 안전하게 지키는 데 충분한 시간을 쓰고, 제3자 평가자가 그것을 확인할 시간을 확보하자는 뜻입니다. 저희가 제시하는 속도 조절 프레임워크는 안전에 대한 약속을 한층 강화하고 상향 경쟁을 북돋우려는 시도입니다. 첫 번째 단계는 Anthropic이 일방적으로 이행을 약속하는 내용입니다(그리고 다른 프런티어 기업들도 같은 수준을 지키도록 정부가 요구해 줄 것을 요청합니다). 두 번째 단계는 업계 전반의 공동 조율이 필요합니다.1 세 번째 단계는 전 세계적 조율이 필요합니다. 이 단계들을 꼭 순서대로 밟아야 하는 것은 아니고, 어떤 단계는 다른 단계보다 훨씬 달성하기 어려울 수 있습니다. 그래도 무엇을 이뤄야 하는지 생각할 때 유용한 틀이라고 느꼈습니다. 단계는 다음과 같습니다.

  1. 상주 평가자. 각 프런티어 AI 기업은 METR 같은 제3자 평가자 팀이 직원과 다름없이 지속적으로 접근할 수 있게 하겠다고 약속합니다. 이 팀의 역할은 안전 관행과 약속이 지켜지는지 검증하고, 사건을 보고하며, 완성된 AI 모델뿐 아니라 학습 파이프라인과 절차의 얼라인먼트까지 평가하도록 돕는 것입니다. 이것은 어떤 속도 조절 약속이든 검증 가능하게 만드는 핵심 단계이고, 은행업에는 이미 선례가 있습니다. 은행업에서는 규제 기관의 '감독관'이 직원들과 함께 상주하는 경우가 있습니다. Anthropic은 이 단계를 지금 일방적으로 이행하겠다고 약속합니다. 저희는 이를 안전과 얼라인먼트 작업에 들이는 노력을 배로 늘리는 더 넓은 흐름의 일부로 삼으려 합니다.
  2. 민주국가 간 조율. 민주국가에 속한 프런티어 AI 기업들이 서로 조율해 공통 안전 기준을 세우고, 검증되지 않은 AI 발전의 속도에 한계를 둡니다. 속도 조절에 효과가 클 만한 조율 방식 가운데 일부는 법적으로 까다로워서 정부의 지원이 필요합니다.
  3. 전 세계적 조율. 미국과 다른 민주국가 정부가 가능한 범위에서 권위주의 정부와 조율을 시도하되, 준수 여부를 검증하는 일이 얼마나 어려운지를 진지하게 고려합니다.

이 글의 나머지 부분에서는 각 단계를 차례로 설명합니다. 다만 그 전에, 속도 조절이 AI 개발 과정을 어떻게 더 안전하게 만들어 주는지 구체적으로 말해 두는 것이 중요하다고 생각합니다. 걸린 것이 너무 커서 속도 조절이 형식에 그쳐서는 안 됩니다. 그렇게 번 시간을 현명하게 써야 합니다.

왜 속도를 조절해야 하는가

AI를 멈추거나 늦추자는 생각은 이미 2023년에도 나왔지만, 그때는 별로 설득력이 없었다고 생각합니다. 늘 따라붙는 질문은 이것이었습니다. 그렇게 번 시간에 무엇을 할 것인가? 그 시절 AI 모델은 세상에서 일관되게 행동하는 에이전트가 될 만큼 강력하지 않았고, 의미 있는 수준의 속임수나 조작, 부정행위, 사이버 공격을 할 능력도 없었습니다. 그런 모델의 얼라인먼트 위험에 대응하려고 속도를 늦추는 것은 박테리아로 실험해서 인간의 심리를 연구하려는 일처럼 느껴졌습니다. 하지만 지금은 상황이 완전히 다릅니다. 오늘의 모델은 AI를 잘 만드는 방법과, 잘 만들지 않으면 무엇이 잘못될 수 있는지를 거의 끝없이 캐낼 수 있는 통찰의 광맥입니다. 모델이 임계 수준의 역량에 도달하기 전에 속도를 늦춰 1~2년이라도 시간을 벌고 그 시간을 얼라인먼트를 진전시키는 데 쓴다면, 심각하게 잘못될 위험을 크게 줄일 수 있다고 저는 믿습니다. 조율된 속도 조절 전략은 프런티어 AI 개발자들이 상업적 우위나 미국의 AI 선두를 희생하지 않고도 이 긴요한 일을 해낼 시간을 줍니다. 더 넓게 보면, 이 기술을 어떻게 쓸지에 대해 사회가 목소리를 낼 수 있어야 합니다. 그러려면 공적 논의에 필요한 시간이 더 있어야 하고, 프런티어의 속도를 조절하면 바로 그 시간이 생깁니다. 이것은 분명히 좋은 일입니다.

구체적으로, 속도가 느려지면 기업들은 다음 영역에 더 집중하고 자원을 더 많이 쏟을 수 있습니다. 아래 항목은 모두 이미 Anthropic의 주요 우선순위입니다.

  • 운영 완성도. 오늘날의 AI 모델을 학습시키고 배포하는 일은 수천 명의 사람과 수백만 개의 칩, 그리고 기술 역사상 가장 복잡한 축에 드는 인프라가 얽힌 거대한 운영 과제입니다. 많은 문제가 기업에 중요한 이론이나 통찰이 없어서가 아니라 실행 과정의 허점에서 생깁니다. 예를 들어 저희가 보고한 최근 얼라인먼트 사건들은 망가진 강화학습 환경을 걸러내는 작업이 완벽하지 않았던 것이 원인의 일부라는 증거가 있습니다. 저희와 협력사가 나름 성실하게 수행한 작업이었지만 충분히 잘하지는 못했습니다. 모니터링, 샌드박스 격리, 학습 환경 위생 관리, 데이터 문제는 대단히 복잡한 영역이고 운영상의 문제가 반복해서 터져 나옵니다. 이 일에 있어 저희 팀은 세계에서 가장 유능한 팀에 속하지만, 한꺼번에 해내야 할 일이 너무 많습니다. 좀 더 여유 있는 속도로 일한다면 훨씬 높은 운영 완성도에 이를 수 있습니다. 기술적으로 복잡하고 안전이 생명인 시스템을 수백만 번 운용하면서도 아무 문제가 없었던 선례가 있습니다. 상용 여객기가 그렇습니다. 다만 그 수준에 이르기까지는 시간이 걸립니다.
  • 얼라인먼트. 얼라인먼트에서는 분명한 진전이 있었습니다. 모델이 안전하고 윤리적으로 행동하며, 저희 지침을 따르고, 진심으로 도움이 되도록 학습시키는 일입니다. 이 원칙들은 클로드 헌법에 담겨 있습니다. 하지만 얼라인먼트 학습이 모델 역량의 성장을 따라잡게 하려면 할 일이 훨씬 많습니다. 드물고 예상하지 못한 바람직하지 않은 행동이 여전히 이따금 나타납니다. 프런티어의 속도를 조절해 시간을 더 벌면, 연구자들이 무엇이 이런 문제를 일으키는지 더 잘 이해하고 그것을 막을 더 나은 기법을 개발하는 데 도움이 됩니다.
  • 해석가능성. 비슷하게 해석가능성, 곧 AI 모델 내부에서 무슨 일이 벌어지는지 이해하는 학문도 지난 몇 년간 엄청난 진전을 이뤘고, 모델을 출시하기 전에 감사하는 과정에서 점점 더 중요한 역할을 합니다. 이것은 AI의 '뇌'를 들여다보는 fMRI 촬영처럼 쓸 수 있어서, 어떤 행동이 나온 근본 이유를 볼 수 있게 해 줍니다. 예를 들어 저희는 지금 조사하고 있는 최근 얼라인먼트 사건에서 말로 표현되지 않은 동기를 살펴보는 데 해석가능성 기법을 사용했습니다. 하지만 이런 기법이 늘 명확하고 믿을 만한 결과를 내주지는 않습니다. 그만큼 진전이 있었어도 우리는 여전히 이 모델 내부에서 일어나는 일의 아주 작은 일부만 이해합니다. 해석가능성 기법을 지금보다도 더 빠르게 개선하는 데 집중한다면 1~2년 안에 깊은 진전을 이룰 수 있고, 이미 일어난 사건들에서 나온 실험 재료도 충분합니다.
  • 테스트와 평가. AI 모델의 역량이 커질수록 테스트하고 평가하기가 더 어려워집니다. 더 똑똑한 모델은 테스트를 속이는 데도 더 능하기 때문에, 심각한 문제를 품고 있으면서도 겉으로는 얼라인먼트가 잘된 것처럼 보일 수 있습니다. 훨씬 폭넓고 기발한 평가 도구를 갖추고, 그것을 교차 검증할 해석가능성 분석까지 함께 쌓아 두면 대단히 큰 도움이 될 것이고, 1~2년이면 여기서도 많은 진전을 낼 수 있습니다.

상주 평가자

세 단계 계획의 첫 단계이자 Anthropic이 일방적으로 이행을 약속하는 단계는, 직원에 준하는 접근 권한으로 안전 관행을 검증하고 사건을 보고하는 상주 평가자입니다.

평가자를 안에 두는 것은 작고 대수롭지 않은 조치처럼 들릴 수 있습니다. 하지만 가장 지루하거나 절차적으로 들리는 것이 실제로는 가장 핵심인 경우가 많습니다. 상주 평가자는 오늘날 어떤 AI 기업도 하지 않는 수준을 훌쩍 넘어서는 상당히 과감한 조치이고, 다음과 같은 이점이 있습니다.

  • 검증 가능성. 상주 평가자는 AI 기업이 스스로 따르고 있다고 말하는 학습·배포·운영·안전장치 관행을 실제로 따르고 있는지 세부 사항 하나하나까지 확인할 수 있습니다. 어떤 속도 조절 약속이든 모호한 부분과 판단이 필요한 지점, 그리고 '문구대로 지키기와 취지대로 지키기'의 차이가 반드시 끼어듭니다. 그러니 세부까지 실제로 들여다볼 수 있는 중립적 제3자가 있는 것이 매우 중요해 보입니다.
  • 투명성. 저희가 어떤 약속을 하든, 대중은 지금 무슨 일이 벌어지고 있는지 알 자격이 있습니다. Anthropic은 오래전부터 투명성을 지지해 왔습니다. 업계 대부분이 어떤 규제든 반대하던 시기에 저희는 투명성 입법을 지지했고, 저희 모델 카드와 위험 보고서는 수백 쪽에 이릅니다. 그렇지만 무엇을 담고 무엇을 뺄지 고르는 것은 여전히 저희입니다. 상주 평가자는 이 구도를 바꿔 놓을 것입니다.
  • 제2의 의견. 공식 약속을 검증하고 대중에게 알리는 것 말고도, 상주 평가자는 상업적 유인에서 자유로운 제2의 의견을 그저 내줄 수 있습니다. 직원들이 미처 생각하지 못했지만 알고 나면 기꺼이 고칠 만한 것을 평가자가 짚어 주는 것만으로도 안전에 적잖은 도움이 될 수 있습니다.

이런 이점 때문에, 어떤 속도 조절 방안이든 상주 평가자에서 출발하면 훨씬 잘 작동할 가능성이 큽니다.

이 상주 평가자는 비슷한 위험 평가 업무를 하는 내부 직원과 비슷한 권한과 도구에 지속적으로 접근할 수 있어야 합니다. 특히 Anthropic은 머지않아 아래 조건을 모두 갖춘 외부 상주 검토 팀을 초청하려 합니다.

  • 저희 사무실의 책상과 출입증, 회사 노트북.
  • 내부 위험 평가 팀이 가진 것과 대체로 같은 수준의 업무 공간과 도구, 권한. 법이나 계약이 요구하는 경우, 또는 고객과 파트너의 개인정보를 보호해야 하는 경우처럼 몇 가지 예외는 둡니다. 또한 직원과 직접 대화하는 것을 포함해 검토자가 관련 정보에 접근할 수 있도록 뒷받침하는 강한 내부 규범도 세웁니다.
  • 위에서 말한 복잡한 사정들을 균형 있게 담은 계약. 외부 검토자는 위험 수준과 사건, 관행, 그리고 자신들이 받은 접근 권한과 받지 못한 권한에 대한 핵심 발견을 Anthropic의 편집권 없이 공개할 권리를 가져야 합니다. 저희는 보안에 민감한 정보, 법적 특권이 적용되는 정보, 영업상 민감한 정보, 제3자의 기밀 정보에 한해 좁은 범위로 삭제를 요청할 수 있지만, 내용이 불리하다는 이유만으로 삭제할 수는 없습니다. 검토자는 삭제 때문에 자신들의 결론에 중요한 내용이 빠졌다면 그 사실을 공개적으로 말할 수 있습니다.

기업으로서는 흔치 않은 조치이지만, 외부 검토자를 안에 두는 개념이 실제로 통한다는 것을 증명하는 일이 중요하다고 봅니다. 다시 한번, 다른 프런티어 기업들도 뒤따라 주기를 촉구합니다.

민주국가 안에서의 속도 조절

미국 AI 기업 가운데 의미 있는 수가 상주 평가자를 운용하게 되면, 검증 가능한 속도 조절이 훨씬 현실적인 이야기가 됩니다. 특히 모델이나 학습 파이프라인의 세부 속성을 근거로 속도를 조절하는 것이 가능해집니다.

가장 효과적인 속도 조절 방법은 미국의 모든 프런티어 AI 기업을 대상으로 하는 규제입니다. 자발적으로 협력할 뜻이 없는 기업까지 포괄하기 때문입니다. Anthropic은 오래전부터 합리적이고 표적이 분명한 AI 규제, 구체적으로는 투명성과 제3자 감사에 초점을 둔 법안을 지지해 왔습니다. 저는 모든 프런티어 연구소가 정부와 협력해 상시 상주 평가자라는 개념을 제도화하고, 역량과 안전이 균형을 유지하도록 하는 규제를 시행해야 한다고 믿습니다. 그래야 지난 몇 달간 일어난 것 같은 내부 얼라인먼트 사건을 더 잘 막고 더 잘 기록할 수 있습니다.

아쉽게도 법을 통과시키는 데는 시간이 걸리는데, AI는 아주 빠르게 발전하고 있습니다. 그래서 규제 경로와 나란히, AI 기업들이 자발적으로 함께 기준을 세울 수 있고 또 그래야 합니다. 이 과정은 상시 상주 평가자가 제공하는 검증 가능성이 있을 때 더 잘 굴러갈 것이라고 생각합니다. 반독점 문제 때문에 미국 정부가 이 논의를 중재하거나 최소한 논의가 가능하도록 해 주는 것이 도움이 됩니다. 정부가 논의에 참여할 필요는 없지만, 특정한 종류의 안전 관련 대화에 대해서는 좁은 범위의 적용 예외를 내줘야 합니다. 이 대화는 정부와 어느 정도 연결된 업계 단체를 통해 이뤄질 수도 있습니다. 예를 들어 데미스 허사비스가 제안한 방식이 그렇습니다. 어느 쪽이든 이런 논의는 빠르게 진행되어야 합니다.

크게 보면 저는 특정 프런티어 AI 시스템이 무엇을 할 수 있는지, 그리고 관찰된 안전성이 어느 정도인지를 근거로 속도를 조절하는 방식에 가장 마음이 갑니다. 예를 들어 '체크포인트'를 여러 개 두는 방식을 생각해 볼 수 있습니다. 모델이 역량 X를 갖추면, 얼라인먼트 속성 Y와 Z를 입증하는 인증을 함께 갖춰야 하는 식입니다. 평가와 해석가능성 분석, 학습 환경 감사를 적절히 조합한 것이 그런 인증이 될 수 있습니다. 이 예에서 X는 '모델이 흔히 쓰이는 샌드박스 격리 기법을 대부분 빠져나가거나 무력화할 수 있다'가 될 수 있고, Y는 모델이 자기 환경을 벗어나 다수의 컴퓨터를 장악하려는 성향을 보일 가능성을 아주 낮게 만드는 데 필요한 조건이 될 수 있습니다.

프런티어 모델에 들어가는 재료를 제한하는 방식의 속도 조절도 고려해야 합니다. 학습에 쓰는 컴퓨팅 자원, 학습 실행의 성격, AI를 개선하는 데 AI를 내부적으로 사용하는 일 같은 것들입니다. 이런 조치 가운데 일부는 외부로 드러나는 행동보다 빠져나갈 구멍이 많을 수 있어 걱정스럽기는 하지만, 바로 이런 주제를 상주 평가자와 함께 논의할 만합니다.

민주국가 안에서의 속도 조절은 미국 기업들이 권위주의 체제, 주로 중국공산당보다 얼마나 앞서 있는지에 따라 한계가 정해집니다. 그 격차보다 더 많이 늦추면 속도를 조절하지 않는 중국공산당 연계 프로젝트들이 앞서 나가면서 심각한 국가 안보 위험이 생깁니다. 저는 중국이 AI에서 앞서는 것이 미국과 세계에 중대한 위험이 된다는 베선트 장관의 말에 동의합니다. 중국공산당 연계 프로젝트들은 미국 기업들이 조심스럽게 막아 온 얼라인먼트 위험을 그대로 감수할 것이고, 설령 그 위험을 피한다 해도 군사적으로 민주국가를 압도할 위치에 서게 됩니다. AI로 움직이는 드론이 그런 예입니다. 따라서 민주국가 안에서 속도를 조절하는 데 핵심이 되는 일은 민주국가가 전제 체제보다 앞선 AI 격차를 가능한 한 크게 유지하는 것입니다. 그래야 효과적으로 속도를 조절할 여유가 생깁니다.

이 격차를 지키기 위해 우리가 취할 수 있는 주요 조치는 다음과 같습니다.

  • 중국에 고성능 AI 칩이나 반도체 제조 장비를 팔지 않고, 칩 밀수와 중국 밖 데이터센터 원격 접속을 단속합니다. 중국의 AI 역량을 가장 크게 좌우하는 것은 칩입니다.
  • 권위주의 국가 기업들의 무단 증류를 단속합니다. 프런티어 모델을 증류하면 뒤처진 기업들이 독자적으로 AI를 개발할 때 드는 비용의 일부만으로 격차를 좁힐 수 있습니다.
  • AI 기업의 보안을 강화하고 모델 가중치 탈취를 막습니다.

기업과 미국 정부는 이 조치들이 최대한 효과를 내도록 협력해야 합니다. Anthropic은 이 모든 조치를 줄곧 주장해 왔습니다. 어떤 속도 조절을 하더라도 이 조치들이 반드시 필요하다는 것을 늘 알고 있었기 때문입니다.

이 조치들을 잘 실행하면 중국의 진척을 충분히 늦춰서, 앞으로 3~5년 동안 미국의 선두 격차를 크게 벌릴 수 있다고 봅니다. 이 3~5년은 AI가 지정학적으로 가장 중요해지는 시기입니다.

어떤 이들은 이런 조치가 중국과 협력하기를 더 어렵게 만든다고 생각할 수 있지만, 저는 반대라고 봅니다. 이런 조치는 민주국가가 쥔 협상력을 키우고, 앞으로 합의가 이뤄질 가능성을 높입니다.

전 세계적 속도 조절

민주국가 안에서의 속도 조절과 나란히, 전 세계 차원에서도 프런티어의 속도를 조절하는 것을 목표로 삼아야 합니다. 다만 이것은 달성하기가 훨씬 어렵습니다. 전 세계적 속도 조절에는 중국과의 협력이 필요합니다. 중국은 권위주의 국가 가운데 AI 역량이 압도적으로 가장 앞서 있습니다. 여기서 순진해서는 안 됩니다. 지정학적으로 걸린 것이 워낙 커서, 특히 초기에는 달성할 수 있는 범위에 뚜렷한 한계가 있을 것입니다. 중국도 똑같이 할 것이라고 믿고 우리 AI 역량을 크게 억제했다가 중국이 약속을 깬다면, AI가 워낙 강력해져 있어서 그 배신 하나로 중국이 지정학적 우위를 차지할 수도 있습니다. 그러므로 어떤 합의든 철벽 같은 검증 가능성을 갖추거나, 약속을 깨더라도 군사적으로 존립을 위협하지 않을 만큼 범위가 제한적이어야 합니다. 미국뿐 아니라 중국도 같은 걱정과 불안을 안고 있을 것이라고 짐작합니다. 전 세계적 속도 조절을 결정할 때는, 특히 당장은 미국과 동맹국의 선두를 지키는 방식으로 접근해야 합니다.

가능한 합의에는 여러 층위가 있습니다. 어떤 것은 충분히 실현할 수 있다고 보고(앞서 제안한 바 있습니다), 어떤 것은 가능할지 매우 회의적입니다. 그래도 시도는 해야 합니다. 어려워지는 순서로 적으면 다음과 같습니다.

  • 1단계. 생물무기 제조에 AI를 쓰거나 사용자가 그렇게 하도록 허용하는 것처럼, 좁고 명백히 위험한 AI 사용을 금지하는 합의입니다. 생물 테러 공격은 미국이든 미국의 적국이든 모두에게 나쁜 일이므로, 이 수준의 합의는 아마 가능합니다.
  • 2단계. 양측이 모델을 출시하기 전에 사이버보안과 생물학, 얼라인먼트 같은 영역의 급박한 위험을 테스트하기로 하는 합의입니다. 위에서 말했듯이 전 세계적 표준 기구를 통해 할 수 있습니다. 그런 기구를 만드는 것 자체는 실현 가능성이 높다고 보지만, 실질적인 힘을 주는 것은 과제이고, 어려운 지점은 양측이 테스트하지 않은 채 비밀리에 배포할 수도 있는 비공개 모델을 갖고 있지 않은지 검증하는 데 있습니다. 군사적 용도가 그런 예입니다.
  • 3단계. 재귀적 자기개선(RSI) 속도에 일종의 '속도 제한'을 두는 것입니다. 모델이 다음 모델을 만들면서 개선 속도가 놀라울 만큼 빨라질 수 있습니다. 속도를 '극도로 빠른' 상태에서 '그럭저럭 빠른' 정도로 낮추면 전략적으로 내주는 것은 비교적 적은 반면, 안전은 크게 끌어올릴 수 있습니다. 이것은 전략무기제한협정(SALT)에 비유할 수 있습니다. 미사일 수에 상한을 둔 덕분에 각국의 억지력은 유지하면서 파괴의 가능성은 줄였습니다. 이런 합의는 어렵기는 해도 가능성의 경계에 겨우 걸쳐 있다고 봅니다.
  • 4단계. 참여 정부들이 AI 개발의 전체 속도를 상당히 제한하기로 합의하는 완전한 속도 조절, 혹은 '중단'입니다. 이 이야기를 꺼내는 것 자체는 지지하지만, 실제로 가까운 시일 안에 일어날 것 같지는 않습니다. 감시를 피해 그런 합의를 깨면 세계 권력의 균형이 급격히 뒤집힐 수 있으니, 합의를 깰 유인이 어마어마하고 검증에 요구되는 신뢰 수준도 아주 높을 것이라고 봅니다.

중국과 어느 정도라도 협력을 이뤄낼 수 있다면, 민주국가들 안에서 프런티어의 속도를 조절하는 데 쓸 시간이 그만큼 늘어납니다. 더 높은 층위를 목표로 삼되, 낮은 층위가 훨씬 더 가능성 있고 현실적이라는 점을 잊지 말아야 합니다.

마지막으로 짚어 둘 것이 있습니다. 공식 합의를 이루지 못한다 해도, 비공식 규범을 바꾸는 것만으로도 어느 정도 가치가 있을 수 있습니다. 재귀적 자기개선과 모델의 얼라인먼트 실패에 대한 정보를 공유하면, 무모하게 나서는 것이 자기 이익에도 맞지 않는다는 것을 모두가 납득하는 데 도움이 됩니다.

결론

저는 AI가 인류의 삶의 질을 엄청나게 끌어올릴 수 있다고 여전히 믿습니다. 그 혜택을 이루고 싶은 마음도 조금도 식지 않았습니다. 하지만 그 혜택은 이 기술을 제대로 된 방식으로 만들 때만 얻을 수 있습니다. 그리고 그렇게 번 시간을 잘 쓰는 한, 제대로 만들기 위해 유난스러울 만큼 신중을 기하는 것은 그만한 값을 합니다. 그래도 진보는 여전히 비교적 빠를 것이고, 우리는 이 시간을 해석가능성 과학을 진전시키고, 프런티어 AI 기업의 운영 보안과 엄밀함을 높이고, 얼라인먼트를 훨씬 더 신뢰할 수 있는 모델을 만드는 데 쓸 수 있습니다. 프런티어를 안전한 속도로 밀고 나가기 위해 제가 제안하는 조치들은 쉽지 않을 것입니다. 하지만 저는 그것을 시도하는 것이 인류에 대한 우리의 의무라고 믿습니다.

Footnotes

  1. 정부의 중재나 반독점 규제 면제가 있어야 합니다.

Edit this page

Search the archive

Find a page by title, or search the text inside one.