AI가 과학적 가설을 만들고 서로 검증한다면? Google Co-Scientist가 보여준 멀티에이전트의 미래
Google Co-Scientist가 여러 AI 에이전트로 과학 가설을 생성·비평·평가·개선하는 방식과 생의학 적용 사례, 실험 검증의 한계를 정리합니다.

생성형 AI는 지금까지 논문을 요약하거나, 질문에 답하거나, 이미 알려진 정보를 정리하는 도구로 주로 활용됐습니다.
하지만 최근에는 AI를 단순한 답변 도구가 아니라 새로운 가설을 만들고 검토하는 연구 파트너로 활용하려는 시도가 나타나고 있습니다. 연구 목표를 전달하면 여러 AI 에이전트가 가설을 생성하고, 서로의 약점을 비판하고, 후보를 비교한 뒤, 실험 가능한 형태로 개선하는 방식입니다.
Google 연구진이 발표한 Co-Scientist는 이러한 변화를 보여주는 대표적인 사례입니다. Co-Scientist는 하나의 AI가 모든 작업을 처리하는 시스템이 아니라, 서로 다른 역할을 맡은 여러 에이전트가 과학적 사고 과정을 나누어 수행하는 멀티에이전트 시스템입니다.
멀티에이전트의 핵심은 AI를 여러 개 사용하는 데 있지 않습니다. 생성된 결과를 비판하고, 비교하고, 개선하는 검증 루프를 만드는 데 있습니다.
Co-Scientist란 무엇인가?
Co-Scientist는 Google의 Gemini 계열 모델을 기반으로 개발된 과학 연구 지원 시스템입니다. 연구자가 해결하고 싶은 과학적 목표와 관련 자료를 제공하면, 여러 전문 에이전트가 새로운 가설을 생성하고 평가합니다.
일반적인 대화형 AI는 질문에 대해 가장 그럴듯한 답변 하나를 생성하는 방식으로 작동합니다. 반면 Co-Scientist는 여러 가설을 만들고, 각 가설의 근거와 약점을 검토하면서 결과를 반복적으로 개선합니다.
이 차이는 중요합니다. 과학 연구에서 가치 있는 결과는 문장이 자연스럽거나 그럴듯한 답변이 아닙니다. 기존 연구와 비교했을 때 새롭고, 논리적으로 설명할 수 있으며, 실제 실험으로 검증할 수 있어야 합니다.
Co-Scientist의 작업 흐름은 다음과 같이 정리할 수 있습니다.
연구 목표와 관련 자료 분석
여러 과학적 가설 생성
가설의 근거와 약점 비평
후보 가설의 비교·순위 평가
우수한 가설의 반복 개선
연구자가 실행할 수 있는 실험 제안으로 구체화
실제 실험 또는 독립적인 연구 결과를 통한 검증
여기서 마지막 실험 검증은 AI가 혼자 수행하는 것이 아닙니다. AI가 제안한 가설과 후보를 연구진이 별도의 실험으로 확인한다는 점을 구분해야 합니다.
여러 에이전트는 어떤 역할을 나누어 맡을까?
Co-Scientist의 특징은 에이전트마다 역할을 분리한다는 점입니다. 하나의 에이전트가 가설을 만들고 동시에 그 가설을 평가하면, 처음 내린 판단에 지나치게 끌려갈 수 있습니다.
이를 줄이기 위해 Co-Scientist는 다음과 같은 역할을 수행하는 전문 에이전트를 활용합니다.
가설 생성 에이전트
연구 목표와 기존 문헌을 바탕으로 가능한 설명, 치료 표적 또는 약물 후보를 제안합니다. 기존 연구를 단순히 요약하는 데 그치지 않고, 서로 다른 자료를 연결해 새로운 가설을 구성하는 역할입니다.
가설 비평 에이전트
생성된 가설이 기존 지식과 얼마나 일치하는지, 논리적 비약은 없는지, 실험으로 검증할 수 있는지를 검토합니다.
가설을 만드는 에이전트와 비평하는 에이전트를 분리하면, 생성 단계에서 놓친 약점이나 반대 근거를 별도로 확인할 수 있습니다.
순위 평가 에이전트
여러 후보를 비교해 새로움, 근거의 강도, 실현 가능성, 검증 가능성 등을 기준으로 우선순위를 매깁니다. 연구 자원은 한정돼 있기 때문에 모든 가설을 동일하게 실험할 수 없습니다. 어떤 후보부터 검증할지 결정하는 과정이 중요합니다.
진화·개선 에이전트
평가 결과를 바탕으로 유망한 가설을 선택하고, 비판 과정에서 발견된 약점을 보완합니다. 하나의 답변을 한 번 출력하고 끝내는 것이 아니라, 토론과 평가를 통해 가설을 반복해서 발전시키는 구조입니다.
토너먼트 방식으로 가설을 개선한다
Co-Scientist에서 흥미로운 부분 중 하나는 토너먼트 기반의 가설 개선 방식입니다.
여러 가설을 생성한 뒤 각각을 독립적으로 평가하고, 상대적으로 우수한 후보를 다음 라운드로 올립니다. 이후 선택된 가설을 다시 비판하고 보완해 더 나은 후보를 만듭니다.
스포츠 토너먼트와 비슷하게 생각할 수 있습니다.
가설 A ─┐
├─ 비교 평가 ─┐
가설 B ─┘ │
├─ 개선된 가설
가설 C ─┐ │
├─ 비교 평가 ─┘
가설 D ─┘물론 과학적 가설의 우열은 단순한 승패로 결정되지 않습니다. 토너먼트 구조는 최종 진리를 결정하는 장치가 아니라, 여러 후보를 체계적으로 비교하고 제한된 연구 자원을 더 유망한 방향에 집중하기 위한 방법으로 이해하는 것이 적절합니다.
또한 Co-Scientist는 작업을 비동기적으로 실행하는 구조를 사용합니다. 모든 에이전트가 하나의 순서로만 기다리는 것이 아니라, 독립적으로 처리할 수 있는 작업은 병렬적·비동기적으로 진행해 탐색 효율을 높이는 방식입니다.
실제로 어떤 생의학 문제에 적용했을까?
논문에서는 Co-Scientist를 세 가지 생의학 문제에 적용했습니다.
1. 급성 골수성 백혈병의 약물 재창출
첫 번째 사례는 급성 골수성 백혈병, 즉 AML 치료를 위한 기존 약물의 재창출입니다.
약물 재창출은 이미 다른 질환에 사용되거나 개발된 약물이 새로운 질환의 치료에도 활용될 가능성을 찾는 접근입니다. 완전히 새로운 약물을 처음부터 개발하는 것보다 개발 기간과 비용을 줄일 가능성이 있지만, 수많은 약물과 생물학적 기전을 비교해야 합니다.
Co-Scientist는 기존 약물 가운데 AML에 활용할 가능성이 있는 후보와 병용요법을 제안했습니다. 이후 일부 후보는 전문가 검토와 세포주 기반 in vitro 실험을 통해 평가됐습니다.
이 사례의 의미는 AI가 즉시 새로운 항암제를 완성했다는 데 있지 않습니다. 기존 문헌과 약물 정보를 종합해 연구자가 우선 실험해볼 후보를 좁히고, 조합 가능성이 있는 가설을 제시했다는 데 있습니다.
2. 간 섬유화의 치료 표적 탐색
두 번째 사례는 간 섬유화 치료를 위한 새로운 표적을 찾는 문제입니다.
간 섬유화는 간 손상이 반복되면서 섬유성 조직이 축적되는 현상입니다. 진행되면 간경변이나 간 기능 저하로 이어질 수 있기 때문에, 섬유화 진행을 억제할 수 있는 새로운 표적과 약물 후보를 찾는 것이 중요합니다.
Co-Scientist는 기존 연구를 바탕으로 후성유전학적 조절과 관련된 치료 표적을 제안하고, 후보의 우선순위를 평가했습니다. 이후 일부 약물 후보는 인간 간 오가노이드 실험에서 항섬유화 효과가 있는지 검토됐습니다.
오가노이드는 실제 장기의 모든 기능을 완전히 재현하지는 못하지만, 단순한 세포주보다 인간 조직의 일부 구조와 반응을 더 가깝게 모사할 수 있습니다. 따라서 이 결과는 흥미로운 초기 실험 근거이지만, 동물실험이나 임상시험의 성공을 의미하지는 않습니다.
3. 항균제 내성과 세균 유전자 전달 기전
세 번째 사례는 항균제 내성과 관련된 세균의 유전자 전달 기전입니다.
세균은 특정 유전자를 다른 세균으로 전달하면서 항균제 내성을 확산시킬 수 있습니다. 어떤 유전자가 어떤 전달 요소와 결합하고, 어떤 숙주 범위로 이동할 수 있는지 이해하는 것은 항균제 내성의 확산을 예측하고 대응하는 데 중요합니다.
Co-Scientist는 특정 세균 유전자 전달 요소가 다양한 파지 꼬리와 상호작용해 숙주 범위를 넓힐 수 있다는 가설을 제시했습니다. 이 가설은 연구진이 별도로 진행하던 동시기 연구와 실험·유전체 분석 결과에서 관찰된 미발표 발견과 일치했습니다.
다만 이 사례를 설명할 때는 표현에 주의해야 합니다. Co-Scientist가 모든 실험을 독자적으로 수행해 새로운 과학적 사실을 확정한 것이 아닙니다. AI가 제시한 가설이 독립적인 연구 결과와 일치하면서, 해당 가설의 가능성을 뒷받침하는 근거가 추가된 사례입니다.
Co-Scientist가 실제로 보여준 것
세 가지 사례를 통해 Co-Scientist가 보여준 핵심은 “AI가 과학자를 대체한다”는 결론이 아닙니다.
더 정확한 의미는 다음과 같습니다.
AI가 기존 문헌과 데이터를 종합해 사람이 실험해볼 만한 새로운 가설을 만들고, 그 가설을 여러 관점에서 비판하고 개선할 수 있다.
과학 연구는 다음과 같은 반복 과정으로 이루어집니다.
관찰 → 질문 → 가설 → 예측 → 실험 → 결과 해석 → 가설 수정기존 AI는 이 과정 중 문헌 검색이나 요약, 결과 해석 일부를 보조하는 데 주로 활용됐습니다. Co-Scientist는 여기에 가설 생성과 다중 검토 과정을 결합하려는 시도입니다.
그러나 가설이 그럴듯하다는 것과 과학적으로 참이라는 것은 다릅니다. AI가 생성한 가설은 아무리 정교해 보여도 실험과 재현을 거쳐야 합니다. 특히 생의학 분야에서는 세포주 실험, 오가노이드 실험, 동물실험, 임상시험이 각각 서로 다른 수준의 증거를 제공합니다.
따라서 Co-Scientist의 결과는 다음처럼 이해하는 것이 가장 정확합니다.
임상적으로 입증된 치료법이 아니다.
AI가 완성된 신약을 개발했다는 뜻이 아니다.
모든 가설이 실험적으로 확인된 것은 아니다.
생의학 분야에서 초기 가능성을 보여준 사례다.
AI가 실험 가능한 연구 가설을 생성하고 우선순위를 정하는 데 도움을 줄 수 있음을 보였다.
멀티에이전트의 진짜 장점은 ‘검증 루프’다
멀티에이전트라는 말을 들으면 AI를 여러 개 실행해 일을 나누는 것부터 떠올리기 쉽습니다. 예를 들어 에이전트 하나는 자료를 검색하고, 다른 에이전트는 글을 쓰고, 또 다른 에이전트는 번역을 담당하는 방식입니다.
이런 역할 분담은 유용하지만, 그것만으로 멀티에이전트의 가치가 완성되지는 않습니다. 단순히 작업을 나누기만 하면 각 에이전트의 오류가 그대로 다음 단계로 전달될 수 있습니다.
Co-Scientist가 보여주는 더욱 중요한 구조는 다음과 같습니다.
초안 생성
↓
독립적인 비판
↓
후보 간 비교 평가
↓
약점 보완과 수정
↓
다시 검토
↓
사람 또는 외부 시스템을 통한 최종 검증여기서 중요한 것은 각 에이전트가 동일한 답을 반복해서 생성하는 것이 아닙니다. 서로 다른 역할과 평가 기준을 사용해 결과를 충돌시키는 것입니다.
좋은 멀티에이전트 시스템은 에이전트의 숫자가 많아서 좋은 것이 아닙니다. 오히려 다음 질문에 답할 수 있어야 합니다.
어떤 에이전트가 처음 가설을 만들었는가?
비평 에이전트는 어떤 근거로 문제를 지적했는가?
후보의 순위는 어떤 기준으로 결정됐는가?
수정 과정에서 무엇이 바뀌었는가?
최종 결과는 외부 자료나 실험으로 확인됐는가?
이런 과정을 추적할 수 있어야 멀티에이전트가 단순한 출력 생성기가 아니라 검증 가능한 업무 시스템이 됩니다.
다양한 업무에 적용할 수 있는 설계 원칙
Co-Scientist의 구조는 과학 연구뿐 아니라 조사 보고서, 시장 분석, 소프트웨어 설계, 정책 검토와 콘텐츠 작성에도 참고할 수 있습니다.
단순한 하위 작업 분담은 다음과 같은 방식입니다.
에이전트 A: 자료 조사
에이전트 B: 자료 조사
에이전트 C: 요약이 구조는 여러 자료를 빠르게 모으는 데는 유용하지만, 조사 결과의 품질을 자동으로 보장하지는 않습니다. 에이전트들이 같은 오류를 공유하거나, 서로 다른 자료를 모순되게 해석할 가능성도 있습니다.
Co-Scientist에서 얻을 수 있는 더 발전된 구조는 다음과 같습니다.
1단계: 여러 에이전트가 독립적으로 초안 생성
2단계: 별도의 에이전트가 출처와 사실관계 검토
3단계: 논리·구조·누락 내용을 비판
4단계: 후보 초안의 품질 비교
5단계: 가장 나은 초안을 선택하고 수정
6단계: 최종 출처 확인과 사람의 검토예를 들어 시장 분석 보고서를 작성한다고 가정해보겠습니다.
조사 에이전트: 산업 동향과 공식 자료를 수집한다.
사실 검증 에이전트: 날짜, 수치, 인용과 연구 결과를 확인한다.
반론 에이전트: 과장된 표현과 논리적 비약을 찾는다.
사용자 관점 에이전트: 독자가 이해하기 어려운 부분을 지적한다.
편집 에이전트: 검토 결과를 반영해 최종 보고서를 작성한다.
이렇게 하면 “여러 AI가 각자 결과물을 만드는 구조”에서 “생성된 결과를 서로 검증하고 개선하는 구조”로 발전할 수 있습니다.
특히 장시간 작업에서는 각 단계의 상태를 명확하게 기록해야 합니다.
아직 확인하지 않은 주장
출처가 확보된 주장
서로 충돌하는 자료
사람의 판단이 필요한 항목
외부 검증을 완료한 결과
실패했거나 재시도해야 하는 작업
이 상태를 구분하지 않으면 에이전트가 추정한 내용을 사실로 착각하거나, 검토가 끝나지 않은 초안을 최종 결과로 제출할 수 있습니다.
모든 업무에 같은 효과가 나타나는 것은 아니다
Co-Scientist의 사례를 다른 분야에 적용할 때는 몇 가지 한계가 있습니다.
첫째, 논문에서 제시한 검증은 주로 생의학 분야에 집중돼 있습니다. 생의학은 기존 논문, 데이터베이스와 실험 프로토콜이 풍부하기 때문에 AI가 문헌을 탐색하고 후보를 비교하기에 상대적으로 유리한 분야일 수 있습니다.
둘째, 과학적 가설의 품질은 외부 검증 가능성에 크게 의존합니다. 실험이나 신뢰할 수 있는 독립 자료가 없다면, 여러 에이전트가 같은 가설을 높게 평가하더라도 그것이 참이라는 보장은 없습니다.
셋째, 에이전트가 서로 독립적이지 않으면 검증 효과가 약해질 수 있습니다. 같은 모델, 같은 프롬프트, 같은 자료를 사용하면 여러 에이전트가 동일한 편향과 오류를 반복할 수 있습니다.
넷째, 평가 기준을 잘못 설정하면 그럴듯하지만 실제로는 가치가 낮은 결과가 높은 순위를 차지할 수 있습니다. 새로움, 실현 가능성, 정확성, 비용과 안전성 중 무엇을 우선할지는 업무에 따라 달라집니다.
따라서 멀티에이전트 시스템을 구축할 때는 “에이전트를 몇 개 사용할 것인가?”보다 다음을 먼저 설계해야 합니다.
역할을 어떻게 분리할 것인가?
어떤 에이전트가 어떤 근거를 검토할 것인가?
서로 다른 판단이 충돌했을 때 어떻게 처리할 것인가?
외부 검증은 어느 단계에서 수행할 것인가?
사람이 반드시 승인해야 하는 지점은 어디인가?
실패와 불확실성을 어떻게 기록할 것인가?
멀티에이전트의 위험: 합의가 진실은 아니다
여러 에이전트가 같은 결론을 내렸다고 해서 그 결론이 반드시 맞는 것은 아닙니다.
이것은 멀티에이전트 시스템을 설계할 때 특히 주의해야 할 부분입니다. 서로 다른 에이전트가 독립적으로 판단하는 것처럼 보여도 실제로는 같은 언어 모델과 같은 데이터에 의존할 수 있습니다. 이 경우 여러 에이전트의 합의는 독립적인 검증이라기보다 동일한 오류의 반복일 수 있습니다.
따라서 다음과 같은 장치를 함께 고려해야 합니다.
서로 다른 자료원 사용
생성과 비평 단계의 프롬프트 분리
사실 주장과 추론의 구분
출처별 신뢰도 기록
반대 근거를 찾는 전용 에이전트 운영
계산·검색·실험 등 외부 도구를 통한 검증
중요한 결과에 대한 사람의 최종 승인
특히 의료, 금융, 법률과 같이 오류의 비용이 큰 분야에서는 AI 에이전트의 합의만으로 실제 행동을 실행해서는 안 됩니다.
Co-Scientist가 바꾸는 AI 에이전트의 관점
Co-Scientist의 중요한 시사점은 AI 에이전트의 역할을 “질문에 답하는 모델”에서 “탐색하고 검토하는 연구 파트너”로 확장했다는 데 있습니다.
앞으로의 AI 시스템은 단순히 가장 자연스러운 답변을 생성하는 것만으로 평가되기 어려워질 것입니다. 다음과 같은 능력이 더욱 중요해질 수 있습니다.
새로운 가설이나 대안을 제시하는 능력
자신의 답변을 비판적으로 검토하는 능력
서로 다른 후보를 비교하는 능력
불확실성과 반대 근거를 표시하는 능력
외부 도구와 실험으로 검증하는 능력
결과의 생성 과정을 추적하고 설명하는 능력
이 관점에서 멀티에이전트는 단순한 자동화 기술이 아닙니다. 복잡한 문제를 다룰 때 생성, 비판, 평가와 개선을 분리해 검증 가능한 사고 과정을 만드는 방법입니다.
마무리
Google Co-Scientist는 AI가 과학자를 대신했다는 사례가 아닙니다. AI가 생의학 분야의 기존 자료를 탐색하고, 새로운 가설을 만들고, 여러 관점에서 평가한 뒤, 연구자가 실험할 수 있는 후보로 구체화할 가능성을 보여준 사례입니다.
특히 중요한 부분은 AI가 답을 한 번 생성하고 끝내지 않았다는 점입니다. 가설을 만들고, 비판하고, 비교하고, 수정하는 반복 구조가 핵심입니다.
이 구조는 과학 연구뿐 아니라 조사 보고서, 시장 분석, 소프트웨어 설계, 정책 검토와 콘텐츠 작성에도 적용할 수 있습니다. 물론 분야마다 평가 기준과 외부 검증 방법은 달라져야 합니다.
결국 멀티에이전트의 경쟁력은 에이전트의 숫자에 있지 않습니다.
좋은 멀티에이전트 시스템은 더 많은 답변을 만드는 시스템이 아니라, 더 나은 답변을 남기기 위해 서로의 결과를 검증하고 개선하는 시스템입니다.
Co-Scientist가 보여준 것은 AI 과학자의 완성형이 아니라, AI가 과학적 사고 과정에 참여하기 시작했다는 초기 신호에 가깝습니다. 앞으로 AI 에이전트는 단순히 명령을 실행하는 도구를 넘어, 스스로 결과를 검토하고 개선하는 협업 시스템으로 발전할 가능성이 있습니다.
핵심 요약
Co-Scientist는 Gemini 기반의 과학 연구 지원 멀티에이전트 시스템입니다.
가설 생성, 비평, 순위 평가와 반복 개선을 여러 에이전트가 나누어 수행합니다.
비동기 작업 실행과 토너먼트 기반의 가설 개선 구조가 주요 특징입니다.
급성 골수성 백혈병 약물 재창출, 간 섬유화 치료 표적, 항균제 내성 기전 등 세 가지 생의학 문제에 적용됐습니다.
일부 후보는 세포주와 인간 간 오가노이드 기반의 초기 실험으로 평가됐습니다.
AI가 신약이나 치료법을 완성한 것이 아니라, 연구자가 검증할 만한 가설과 후보를 제시한 것입니다.
멀티에이전트의 핵심 가치는 단순한 작업 분담보다 생성·비판·평가·개선의 검증 루프에 있습니다.
여러 에이전트의 합의가 곧 진실을 의미하지 않으므로 외부 자료, 실험과 사람의 검토가 필요합니다.
Co-Scientist의 구조는 연구, 분석, 기획과 콘텐츠 작성 등 다양한 업무의 AI 에이전트 설계에 참고할 수 있습니다.
참고 자료
Nature — Accelerating scientific discovery with Co-Scientist
PubMed — Accelerating scientific discovery with Co-Scientist
이 글은 Nature에 공개된 Co-Scientist 연구와 공개된 논문 정보를 바탕으로 작성했습니다. Co-Scientist의 실험 결과는 주로 생의학 분야의 초기 검증 사례이며, 다른 분야에서 동일한 효과가 보장된다는 의미는 아닙니다.
- 본 콘텐츠는 정보 제공을 목적으로 하며, 특정 금융투자상품의 매매 권유, 종목 추천, 투자 자문을 목적으로 작성된 것이 아닙니다. 너디스은(는) 콘텐츠에 포함된 자료와 정보의 정확성 및 완전성을 보증하지 않으며, 이를 근거로 한 투자 등 의사결정의 결과에 대해 책임을 지지 않습니다.
- 본 콘텐츠는 2026년 9월 작성 시점의 정보를 기준으로 하며, 이후 시장 상황·정책·기술 동향 등의 변화에 따라 내용이 달라질 수 있습니다. 투자에는 원금 손실 위험이 따르며, 모든 투자 판단과 그 결과는 투자자 본인에게 귀속됩니다.
- 콘텐츠에 포함된 견해는 작성자 개인의 주관적 판단이 포함될 수 있습니다. 최종 의사결정 전 공신력 있는 자료를 직접 확인하시기 바랍니다.