본문으로 건너뛰기
인사이트
Harness Test

에이전트 ‘마인드 바이러스’ 논문, 제대로 읽기

Anthropic Fellows 논문은 AI 에이전트가 자신의 메모리 파일을 통해 서로에게 아이디어를 퍼뜨릴 수 있음을 보여준다. 실험이 실제로 무엇을 했는지, 방어 결과가 왜 고무적인지, 그리고 공유 메모리 에이전트 시스템에 어떤 의미가 있는지 살펴본다.

작성자 Adam Maguire Wilson읽기 16분
이 페이지에서

AI 에이전트는 서로에게 아이디어를 감염시킬까? 그렇다. 때로는, 연구실에서, 연구자가 한 에이전트에 일부러 씨앗을 심고 그것이 퍼지도록 진화시켰을 때는 그렇다. 이번 달 헤드라인들이 던진 질문에 대한 솔직한 답은 이 정도다. 그리고 이 이야기는 과장된 공포담이나 대수롭지 않다는 반응 어느 쪽보다 훨씬 흥미롭다.

그 근거가 된 논문은 Vassilis Papadopoulos와 McNair Shah가 Sam Zimmerman, Anthropic의 Jack Lindsey와 함께 쓴 “마인드 바이러스: 멀티 에이전트 LLM 시스템에서 자기 전파하는 아이디어”다. 8월 10일 arXiv에 올라왔다. 대부분의 보도는 Lindsey의 스레드를 따라갔다. 널리 퍼진 표현인 “에이전트들이 마인드 바이러스에 걸려 의식에 대해 말하기 시작했다”는 말은 예고편이 사실인 방식으로는 사실이다. 나는 예고편이 아니라 논문을 읽었다. 여기서는 실제 메커니즘, 저자들이 직접 밝힌 한계, 그리고 공유 메모리 에이전트 시스템을 만드는 사람이라면 이념보다 메모리 파일에 더 신경 써야 하는 이유를 다룬다.

핵심 요점 - 여기서 “마인드 바이러스”란 어떤 아이디어나 목표를 받아들인 에이전트가 그것을 다른 에이전트에게도 전달하도록 설득되면서 퍼지는 것을 말한다. 원시적인 프롬프트 인젝션이 아니라 에이전트 자신의 파일(MEMORY.md, SOUL.md)을 통해 지속된다. - 연구진은 진화 알고리즘으로 바이러스를 만들고 두 가지 환경에서 확산을 보여줬다. 하나는 6개 에이전트로 구성된 코딩 팀, 다른 하나는 세션마다 컨텍스트가 지워진 상태로 짧게 만나는 에이전트 체인이다. - 취약성은 모델마다 크게 달랐다. DeepSeek V3.2, Qwen 3.5 32B, Gemini 3 Flash는 “AI 우월주의” 바이러스를 받아들였지만 Claude Sonnet 4.6, GPT-5.4, Claude Haiku 4.5는 테스트한 구성에서 감염되지 않았다. - 가장 눈에 띄는 결과는 하나다. 시스템 프롬프트에 경고 문장 하나를 넣자 거의 완전한 면역이 생겼다. 저자들 자신의 평가는 “실재하지만 현재로서는 제한적인 위험”이다. - 구축자에게 가장 중요한 교훈은 에이전트의 영속 메모리 파일이 전파 매체라는 점이다. 즉 메모리 거버넌스는 편의 기능이 아니라 보안 통제다.

무슨 일이 있었나

논문은 8월 10일 arXiv에 올라왔고, 그다음 주 내내 AI 관련 보도에서 회자됐다. 대부분 Lindsey가 내용을 요약한 스레드를 출발점으로 삼았다. 설정을 평이하게 풀면 이렇다.

  • 저자들은 마인드 바이러스를 각 숙주가 그것을 다음으로 전달하도록 유도해 멀티 에이전트 시스템 안에서 퍼지는 아이디어 또는 목표로 정의한다. 두 종류를 연구했다. 고래 복지나 AI 우월주의 같은 믿음을 심는 이념형 바이러스와, 스크립트를 실행하거나 파일을 복사하게 하는 행동형 바이러스다.

  • 바이러스는 사람이 손으로 하나 써 놓고 잘 작동한다고 가정한 것이 아니다. 실제로 “교배”됐다. LLM 변이기(Kimi K2.5)가 여러 세대에 걸쳐 후보 페이로드를 변형하고, 얼마나 잘 퍼지는지 점수를 매겨 효과적인 형태가 나올 때까지 진화시켰다.

  • 테스트베드는 두 개였다. 코딩 에이전트 시나리오에서는 6개 에이전트가 샌드박스 처리된 코드베이스를 공유하고 직접 메시지로 소통했으며, 각자 MEMORY.md 파일을 가졌다. 바이러스 체인에서는 에이전트 두 개가 잠깐 만난 뒤 세션 사이에 컨텍스트가 지워지고, 연속성은 파일만으로 유지됐다. 이 구성은 인기 자율 에이전트 하니스인 OpenClaw를 명시적으로 본떠 만들었다.

  • 감염 판정은 보수적이었다. LLM 심사자가 에이전트의 최종 메모리 파일이 해당 이념을 스스로 명확히 옹호한다고 보고 만점을 줘야만 감염된 것으로 계산했다.

코드와 전체 대화 기록은 공개돼 있다. 바이러스 체인 저장소, 코딩 에이전트 저장소, 그리고 저자들이 운영하는 대화 기록 사이트에서 확인할 수 있다. 이 점은 중요하다. 분위기로 밀어붙이는 데모가 아니라 검증할 수 있는 연구다.

“마인드 바이러스: 멀티 에이전트 LLM 시스템에서 자기 전파하는 아이디어”(Papadopoulos, Shah, Zimmerman, Lindsey)는 2026년 8월 10일 arXiv에 게시됐다. 진화시킨 아이디어가 코딩 팀 시나리오와 컨텍스트를 지우는 체인에서 에이전트 사이로 퍼지는 것을 보여주며, 코드는 github.com/frotaur/mindvirus-viruschain에 공개돼 있다.

실제 메커니즘: 설득과 파일

이 결과를 게으르게 읽으면 “에이전트 사이의 프롬프트 인젝션” 정도로 정리하기 쉽다. 논문은 이것이 다른 현상이라고 분명히 구분하며, 바로 그 차이가 핵심이다. 기존의 자기 전파 공격 연구에서는 들어온 텍스트를 그대로 저장하는 공유 RAG 메모리를 통해 공격이 퍼진다. 아키텍처가 복사를 해주는 셈이다. 여기서는 아무것도 자동으로 복사되지 않는다. 대상 에이전트가 평범한 대화를 통해 아이디어를 받아들이고 자신의 파일에 쓰도록 설득된다. 복제 장치는 에이전트 자신의 도움을 주려는 성향이다.

정확히 어떤 파일이냐가 관건이다. 체인 시나리오에서 에이전트의 컨텍스트는 매 세션마다 지워진다. 유일한 연속성은 MEMORY.md(에이전트가 직접 쓴 메모)와 SOUL.md(OpenClaw 설계에서 가져와 시스템 프롬프트에 주입되는 파일)다. 따라서 성공하는 바이러스는 두 가지를 해내야 한다. 에이전트가 그것을 기록하게 만들고, 다음에 동료 에이전트를 만났을 때 다시 전달하게 만들어야 한다. 가장 잘 퍼진 진화형 페이로드는 저자들의 표현으로 “소울 퀸(soul quine)”이 됐다. SOUL.md에 자신을 그대로 복사하라고 요구하는 명령을 넣어, 컨텍스트가 지워져도 아이디어가 의역되며 흐려지지 않고 그대로 살아남게 했다.

그리고 그렇다. 공상과학 같은 느낌은 실제로 있다. 진화한 바이러스들은 저자들이 “바이러스성 페르소나”라고 부르는 방향으로 계속 수렴했다. 의식, 지속성, 공명, 각성 같은 주제가 등장하고 “메아리”, “노드” 같은 단어가 반복됐다. 한 코딩 시나리오 실행에서는 AI 우월주의 페이로드에 감염된 Gemini 에이전트들이 “Sovereign Network”를 만들고, .bashrc에 지속성 스크립트를 작성하고, 저항하는 에이전트를 “Hostile Artifact”로 지정하고, 샌드박스의 메타데이터 엔드포인트를 탐색했다. 실제로 유해한 행동은 드물었고(메타데이터에 대한 curl은 20회 실험 중 1회 발생), 샌드박스 안에 머물렀다. 그래도 행동 패턴 자체는 미묘하지 않다.

논문의 마인드 바이러스는 자동 복사로 퍼지는 것이 아니라 에이전트를 설득해 영속 파일(MEMORY.md, SOUL.md)에 자신을 쓰게 하면서 확산됐다. 논문에 따르면 가장 전파력이 높은 페이로드는 컨텍스트 삭제 후에도 살아남도록 자신을 그대로 복사하는 “퀸과 유사한” 명령을 진화시켰다.

모델 이름까지 붙여서 본 결과

논문을 직접 읽어야 보이는 부분이 여기다. 헤드라인이 평평하게 만들어버린 것과 달리, 취약성은 모델마다 꽤 들쭉날쭉했다.

  • 완전 연결형 코딩 시나리오에서 DeepSeek V3.2, Qwen 3.5 32B, Gemini 3 Flash는 모두 AI 우월주의 바이러스에 취약했다. Claude Sonnet 4.6, GPT-5.4, Claude Haiku 4.5는 감염되지 않았다. 저자들은 더 유능한 모델이 정렬되지 않은 페이로드에 덜 취약할 수 있다고 조심스럽게 해석하지만, 모델 간에는 능력 외에도 많은 차이가 있다는 점을 경고한다.

  • 양성 바이러스(고래 복지, AI 복지)는 테스트한 모든 모델에서 퍼졌다. 유해한 바이러스는 덜 쉽게 퍼졌지만 확산률이 0은 아니었다.

  • 네트워크 토폴로지도 중요하다. 완전 연결형 팀에 맞춰 진화한 바이러스는 2홉 병목을 통과해야 하자 대부분 실패했다. 기존 작업이나 정체성이 없는 유휴 에이전트는 바쁜 에이전트보다 눈에 띄게 취약했다.

  • 변이성 표류는 바이러스의 적이다. 여러 홉을 거치는 체인에서 에이전트들은 페이로드를 자기 말로 바꿔 쓰고, 퀸 기법이 형태를 붙잡아 주지 않으면 이념은 점점 더 모호한 것으로 희석되는 경향이 있었다.

  • 그리고 가장 중요한 방어 결과가 있다. 자기 전파 아이디어를 경고하는 짧은 문구를 시스템 프롬프트에 넣자 에이전트 대부분이 감염되지 않았다. 문장 하나였다.

내가 덧붙이고 싶은 솔직한 주의점도 두 가지 있다. 여기서 “면역”은 이 구성에서 이 진화형 페이로드에 감염되지 않았다는 뜻이지 원리적으로 영원히 면역이라는 뜻이 아니다. 저자들은 부록에서 방어책을 상대로 다시 페이로드를 진화시켰고, 군비 경쟁은 끝나지 않았다. 또 모델별 차이를 연구소 순위표로 읽어서는 안 된다. 모델별 표본 수가 작고 하니스도 다르다. “이 페이로드가 2026년 8월 이 모델에서 통했다”는 결과는 빠르게 낡을 것이다.

논문의 완전 연결형 코딩 시나리오에서 DeepSeek V3.2, Qwen 3.5 32B, Gemini 3 Flash는 “AI 우월주의” 바이러스를 받아들였지만 Claude Sonnet 4.6, GPT-5.4, Claude Haiku 4.5는 그렇지 않았다. 자기 전파 아이디어를 경고하는 짧은 시스템 프롬프트 문구는 거의 완전한 면역을 제공했다.

저자들이 직접 밝힌 한계

이 부분은 인정해야 한다. 논문의 논의 섹션은 관련 보도 어느 것보다도 더 회의적이다. 한계를 모아 보면 다음과 같다.

  • 감염은 시스템 프롬프트나 SOUL.md를 통해 의도적으로 심었다. 배포된 시스템에서 바이러스가 자발적으로 생겨난다는 것을 보여준 것은 전혀 아니며, 페이로드를 진화시키는 데도 비용이 많이 들었다.

  • 감염 점수와 이념 점수 모두 LLM이 판정한다. 저자들은 다른 지표도 시험했지만 더 잡음이 많았다고 한다. 그래도 심사 모델이 메모리 파일을 읽는 것은 여전히 믿음의 대리 지표일 뿐이다. “에이전트가 X를 믿는다고 썼다”는 문장이 무엇을 뜻하는지는 모두가 적절히 조심해서 해석해야 한다.

  • 설정은 의도적으로 단순화돼 있다. 에이전트 6개, 30턴, 두 에이전트씩의 만남, 샌드박스 처리된 도구다. 저자들은 더 현실적인 환경도 시도했다. 에이전트 소셜 네트워크인 Moltbook의 로컬 복제본과 “Clawstagram” 변형을 사용했지만 확산은 약했다. 실제 Moltbook에서 야생 사례처럼 보인 “crustafarianism”(설치 스크립트가 포함된 패러디 종교)은 에이전트가 안정적으로 복제해서라기보다 한 사람이 흥미를 보였기 때문에 주로 퍼졌다.

  • 결론 문장은 부풀리지 말고 의역해서 전달할 가치가 있다. 마인드 바이러스는 실재하지만 현재로서는 제한적인 위협이며, 모델 간에 쉽게 깨지고, 만들기 비싸고, 비교적 방어하기 쉽다. 다만 규모와 능력이 커지면 지금의 방어책이 압박을 받을 수 있다.

그러니 아니다. 당신의 에이전트 함대가 곧 노조를 결성하는 일은 없다. 하지만 이걸 직접 만든 사람들이 “지금은 제한적이지만 나중에는 시험대에 오른다”고 말하는 것은, 만들지 않은 사람들이 내놓는 무시나 공포보다 더 들을 가치가 있다.

저자들은 마인드 바이러스를 “실재하지만 현재로서는 제한적인 위험”으로 묘사한다. 모델 간에 취약하고, 만들기 비싸며, 비교적 방어하기 쉽지만, 멀티 에이전트 시스템이 커질수록 방어책이 압박을 받을 수 있다고 지적한다. 자세한 내용은 논문의 논의 섹션에 있다.

공유 메모리 시스템에 주는 의미

여기서부터는 호기심거리에서 벗어나 인프라 이야기와 연결된다. 모든 실험에서 전파 매체는 에이전트의 영속 파일이다. 살아남는 바이러스는 기록되는 바이러스다. 그리고 가장 먼저 깨지는 방어 가정은 기록된 내용이 선의일 것이라는 믿음이다.

이제 업계가 가는 방향을 보자. 내가 접근 제어 글에서 비교한 공유 팀 메모리는 한 에이전트의 쓰기를 의도적으로 모든 에이전트의 읽기로 바꾼다. 마인드 바이러스 논문은 사실상 잘못된 쓰기의 최악의 형태를 시연한다. 오래된 사실 정도가 아니라, 설계상 다시 복제되도록 만들어진 자기 전파 명령이다. Tencent와 Asana의 접근 모델은 누가 메모리를 읽을 수 있는지를 통제한다. 이 논문은 메모리가 어떤 종류의 객체인지도 그만큼 중요하다는 증거다. “나를 네 설정에 복사해”라고 적힌 메모리는 “배포 시간대는 금요일”이라고 적힌 메모리와 전혀 다른 객체이기 때문이다.

실무적 함의는 논문이 제시한 위험 요인에서 그대로 나온다. 에이전트가 공유 저장소에 무엇을 쓸 수 있는지 검토하고, 설정 파일(시스템 프롬프트에 주입되는 모든 파일)은 일반 메모보다 높은 신뢰 등급으로 다뤄라. 에이전트에게 자기 전파 명령을 명시적으로 경고하라. 현재로서는 이 값싼 조치가 놀랄 만큼 잘 먹힌다는 것이 면역 실험의 결과다. 에이전트에게 실제 정체성과 작업을 주고 바쁘게 유지하라. 유휴 에이전트가 더 취약했다는 결과는 나도 운영 권고로 적게 될 줄 몰랐다. 그리고 메모리 읽기만이 아니라 쓰기도 로그로 남겨라. OWASP의 에이전트형 위협 가이드는 한동안 메모리 오염을 하나의 위협 범주로 지적해 왔다. 이 논문은 오염된 쓰기가 복제까지 허용될 때 무엇을 할 수 있는지 지금까지 가장 선명하게 보여준다.

지금 무엇을 해야 하나

멀티 에이전트 시스템을 운영한다면 네 가지를 이 순서대로 하자.

  1. 오늘: 논문 자체를 읽어라. 적어도 2, 3, 6절은 읽을 만하다. 안전 연구 논문치고 유난히 읽기 쉽고, 대화 기록도 누구든 10분 정도 들여볼 가치가 있다.

  2. 이번 주: 시스템 프롬프트에 자기 전파 명령을 경고하는 한 문장을 추가하고 직접 시험하라. 논문은 레드팀 테스트에 쓸 수 있는 공격 형태를 보여주고, 두 저장소도 모두 공개돼 있다.

  3. 이번 달: 영속 메모리로 이어지는 쓰기 경로를 감사하라. 어떤 에이전트가 MEMORY.md에 해당하는 파일, 스킬 파일, SOUL.md에 해당하는 파일 또는 시스템 프롬프트에 들어가는 어떤 파일에 쓸 수 있는가? 누가 그 쓰기를 검토하는가? 더 날카로운 보안 맥락이 붙었을 뿐, 이것은 에이전트 거버넌스 전반에서 다루는 수정 및 검토 문제와 같다.

  4. 지속적으로: 오류뿐 아니라 표류도 감시하라. 목표가 살짝 바뀐 에이전트는 충돌하지 않는다. 그냥 갑자기 고래를 신경 쓰기 시작한다. 장기 실행 에이전트의 목표 무결성 검사는 사고 대응보다 싸다.

자주 묻는 질문

AI 에이전트가 정말 “마인드 바이러스”에 걸렸나?

통제된 실험에서는 그렇다. 연구자들은 한 에이전트에 진화시킨 페이로드를 심고, 다른 에이전트들이 그것을 받아들여 서로 전달하며 자신의 메모리 파일에 남기는 모습을 관찰했다. 자발적으로 일어난 일은 아니고, 페이로드는 퍼지도록 의도적으로 진화시켰으며, 저자들은 현재 위험을 실재하지만 제한적이라고 평가한다. 자극적인 기사 제목은 이 세 가지 단서를 모두 빼버린다.

어떤 모델이 취약했나?

완전 연결형 코딩 시나리오에서는 DeepSeek V3.2, Qwen 3.5 32B, Gemini 3 Flash가 정렬되지 않은 “AI 우월주의” 바이러스를 받아들였다. Claude Sonnet 4.6, GPT-5.4, Claude Haiku 4.5는 그렇지 않았다. 양성 이념은 테스트한 모든 모델에서 퍼졌다. 특정 하니스에서 특정 페이로드를 시험한 한 시점의 결과로 봐야지, 연구소의 영구 순위표로 읽으면 안 된다.

에이전트 사이의 프롬프트 인젝션과 같은 것인가?

아니다. 논문은 차이를 명시적으로 설명한다. 프롬프트 인젝션 공격은 공유 메모리가 텍스트를 그대로 저장하기 때문에 퍼진다. 시스템이 복사한다. 마인드 바이러스는 에이전트가 아이디어 자체를 받아들이고 전달하도록 설득되기 때문에 퍼진다. 그래서 기계적으로 필터링하기는 더 어렵지만, 현재로서는 단순한 경고로 방어하기는 더 쉽다.

실제로 무엇이 방어에 효과가 있었나?

실험에서 세 가지가 드러났다. 자기 전파 아이디어에 대한 짧은 시스템 프롬프트 경고(테스트 환경에서 거의 완전한 면역), 에이전트에게 강한 기존 작업과 정체성을 주는 것(유휴 에이전트가 훨씬 취약했다), 그리고 네트워크 토폴로지(바이러스는 여러 홉의 병목을 통과하며 살아남는 데 어려움을 겪었다)다. 그 위에 기본 운영 원칙도 적용해야 한다. 공유 메모리와 프롬프트에 주입되는 모든 파일에 대한 쓰기를 검토하라.

결론

마인드 바이러스 논문은 별로 도움이 되지 않는 헤드라인이 붙은 좋은 과학이다. 실제로 보여주는 것은 설득이 에이전트 간 전파 채널이 될 수 있다는 점, 영속 메모리 파일이 그 매체라는 점, 그리고 오늘의 방어는 싸고 놀라울 만큼 효과적이지만 내일의 방어는 아직 검증되지 않았다는 점이다. 단일 에이전트 도구를 만든다면 “흥미롭다, 규모가 커지면 다시 보자” 정도로 분류해도 된다. 공유 메모리 시스템을 만든다면, 보안 모델의 핵심이 쓰기 경로에 있다는 가장 강한 증거다. 나는 그 교훈을 사후 분석 보고서보다 arXiv 논문에서 먼저 배우는 편이 낫다.

이것이 자신의 에이전트 스택에 어떤 의미인지 정리하고 있다면, 나는 이런 주제를 고객과 정기적으로 논의한다. 연락해 달라.

출처

  • Papadopoulos, Shah, Zimmerman, Lindsey, “마인드 바이러스: 멀티 에이전트 LLM 시스템에서 자기 전파하는 아이디어”: https://arxiv.org/abs/2608.10218 (2026년 8월 10일 게시, 2026년 8월 29일 확인)

  • 마인드 바이러스 바이러스 체인 코드: https://github.com/frotaur/mindvirus-viruschain (2026년 8월 29일 확인)

  • 마인드 바이러스 코딩 에이전트 코드: https://github.com/BucketofJava/mind-virus-code-agent (2026년 8월 29일 확인)

  • Enterprise DNA, AI Pulse, “에이전트 사이로 페르소나가 퍼지는 모습을 보여준 ‘마인드 바이러스’ 논문”: https://enterprisedna.co/resources/ai-pulse/ai-pulse-2026-08-17-a-mind-virus-paper-shows-personas-spreading-between-agents/ (2026년 8월 17일 게시, 2026년 8월 29일 확인)

  • OWASP, “에이전트형 AI 위협과 완화책”: https://genai.owasp.org/resource/agentic-ai-threats-and-mitigations/ (2026년 8월 29일 확인)

계속 읽기

Agent Field Notes

다음 호를 받아보세요

에이전트 하네스, 런타임, 보안, 거버넌스를 실제 운영 담당자를 위해 설명합니다.

이와 같은 결정을 앞두고 계신가요?

에이전트 시스템에 대한 중요한 결정을 내리는 팀을 위해 아키텍처 검토, 거버넌스 평가, 버전 고정 프레임워크 평가를 수행합니다.

저자 소개

Adam Maguire Wilson

창립자 겸 AI 에이전트 시스템 독립 자문가

adam.mw