7월 29일 (수) 뉴스 보기

2026년 7월 29일 · 4² AI 뉴스레터

과학계에 도입된 AI 코드 에이전트, 혁신 가속화

OpenAI

파이랩 정리

과학 컴퓨팅과 에이전트 AI의 시대

과학 컴퓨팅은 현대 연구의 핵심 기둥으로, 학계와 산업 전반에 걸쳐 중요한 역할을 하고 있습니다. 그러나 과학 정보를 분석하는 데 필요한 소프트웨어는 데이터 생성의 빠른 속도를 따라가지 못하고 있습니다. 많은 연구 도구는 연구 논문에 첨부된 코드로 시작되었으며, 소규모 학술 팀이 제한된 엔지니어링 경험과 최소한의 시간으로 패키징, 테스트, 최적화 또는 장기 지원을 제공하면서 개발되었습니다. 그 결과, 과학 인프라는 종종 느리고 취약한 워크플로우에 의존하게 되어 지속적인 유지보수가 필요하고, 이는 발견의 속도를 저해합니다.

AI 에이전트는 이러한 방정식을 변화시키기 시작했습니다. 엔지니어링 작업의 비용을 낮추고 지루한 구현 작업을 수행함으로써, 연구자들이 아이디어를 더 빠르게 프로토타입하고, 이전에는 비현실적이었던 프로젝트를 추구하며, 소프트웨어를 더 쉽게 장기적으로 유지할 수 있도록 돕습니다. 그 결과, 과학 소프트웨어는 더 효율적이고 잘 유지되며, 연구자들은 발견에 더 많은 시간을 할애할 수 있게 됩니다.

우리는 주로 생명 과학 분야에서 에이전트가 지원하는 8개의 과학 컴퓨팅 프로젝트에 대한 탐색 보고서를 공유합니다. 5개는 Codex만을 사용하고, 3개는 Codex와 Claude Code를 조합하여 사용했습니다. 이 보고서는 각 프로젝트의 팀이 작성한 사례 연구를 모아 반복되는 주제를 식별합니다. 프로젝트는 일상적인 유지보수와 목표 최적화에서 대규모 언어 마이그레이션 및 GPU 네이티브 재설계에 이르기까지 다양합니다. 기여자들은 에이전트가 소프트웨어 개발 및 유지보수를 크게 가속화했으며, 경우에 따라 소규모 팀이 훨씬 더 많은 시간이나 전문 엔지니어링 지원이 필요했을 작업을 수행할 수 있도록 도왔다고 보고합니다. 그러나 결과 도구의 명확하고 장기적인 책임과 관리의 지속적인 도전도 강조합니다.

기여자들은 일관되게 연구자의 역할이 구현에서 검증 및 오케스트레이션으로 이동했다고 설명합니다. 무엇을 구축할지 명시하고, 정확성을 측정하는 방법을 정의하며, 프로젝트가 언제 출하 준비가 되었는지를 결정합니다. 이 새로운 모델에서 연구자들은 과학적 방향과 품질 기준을 통제하지만, 에이전트의 도움으로 속도가 증가합니다.

사례 연구

유전자 데이터 구문 분석을 위한 널리 사용되는 라이브러리 현대화

cyvcf2는 유전자 변이 파일을 읽고 쓰기 위한 Python 라이브러리입니다. GPT-5.5는 라이브러리의 기존 빌드 및 패키징 시스템을 현대적이고 통합된 프로세스로 대체하여 설치, 테스트 및 릴리스를 더 쉽게 만들었습니다.

코딩 에이전트를 사용하면 빠르게 진행할 수 있습니다. 그러나 과학에서 멀리 가기 위해서는 여전히 전문가의 지도, 이해, 취향, 그리고 주의가 필요합니다.

—Brent Pedersen

반복되는 주제

프로젝트의 범위는 다양했지만, 코딩 에이전트가 과학 컴퓨팅에서 엔지니어링 노동과 전문성을 덜 제약하게 만들고 있음을 보여주었습니다. 이제 병목 현상은 AI 에이전트의 출력을 검증하는 것으로, 여전히 인간의 판단에 의존합니다.

사례 연구 전반에서 에이전트는 특정하고 잘 정의된 요청을 효과적으로 처리했지만, 그들의 작업이 과학적으로 유효한지 또는 기대에 부합하는지를 신뢰할 수 있게 판단하지 못했습니다. 실제로 에이전트는 명백한 오류가 포함된 작업에도 자신감을 표현하는 경우가 많았습니다. 따라서 인간 검토자는 결과를 검증할 신뢰할 수 있는 방법을 찾아야 했습니다. 가장 강력한 접근 방식은 외부 참조 또는 정확한 출력 일치, 기존 도구와의 동등성, 적절한 통계적 행동, 또는 시뮬레이션 데이터로 사전에 확립된 답변과 같은 측정 가능한 수용 목표를 사용하는 것이었습니다.

또 다른 반복되는 주제는 프로젝트가 일반적으로 피드백 기반 반복을 사용하여 단계적으로 진행되었다는 것입니다. 기여자들은 광범위한 목표를 더 작은 변경으로 나누고, 중간 벤치마크와 테스트 시스템을 사용하여 에이전트의 작업을 평가하고 개선했습니다. 에이전트는 종종 초기 구현을 빠르게 생성했지만, 엣지 케이스와 미묘한 수치적 차이를 해결하는 데는 훨씬 더 오랜 시간이 걸렸습니다. 구현의 "마지막 마일"을 완료하는 데 가장 많은 작업이 필요했습니다.

전반적으로, 이러한 사례 연구는 에이전트가 연구자들이 구현에 덜 시간을 할애하고 과학적 작업을 지휘하는 데 더 많은 시간을 할애할 수 있게 한다는 것을 시사합니다. 사람들은 목표를 정의하고, 복잡한 프로젝트를 관리 가능한 조각으로 나누며, 결과가 과학적으로 유효한지를 판단합니다. 오래된 엔지니어링 제약을 완화함으로써, 에이전트는 연구자들이 구축할 수 있는 것을 확장하고, 그들이 가장 중요한 과학적 질문과 결정에 집중할 수 있도록 합니다.

장기적인 관리의 중요성

연구 소프트웨어의 유지보수 격차는 오랫동안 반복을 느리게 하고 재현성과 신뢰성을 제한해 왔습니다. "연구 코드" 및 오믹스 도구에 대한 연구는 게시된 소프트웨어가 종종 새로운 컴퓨팅 설정에서 제대로 설치되지 않거나 문서화된 대로 실행되지 않음을 발견했으며, 연구자들이 구성 및 디버깅에 상당한 시간을 할애하게 했습니다. 심지어 일상적인 개선도 연구자들의 시간을 절약하고 컴퓨팅 요구를 줄일 수 있으며, 성능 기반 리팩토링 및 재작성은 더 큰 이점을 제공할 수 있습니다.

그러나 구현 비용이 낮아지면 많은 유사한 재작성을 쉽게 생성할 수 있어 사용자를 분산시키고, 하나의 도구를 신뢰할 수 있게 유지하는 데 필요한 전문가의 주의를 분산시킵니다. 이는 장기적인 관리와 속성이 필수적임을 의미합니다. 성숙한 과학 소프트웨어는 문서화되지 않은 관습, 호환성 요구 사항, 사용자 신뢰를 가지고 있으며, 소스 코드를 번역하는 것만으로는 재현할 수 없습니다.

사례 연구는 앞으로 나아갈 수 있는 몇 가지 경로를 보여줍니다. MHCflurry와 cyvcf2에 대한 변경 사항은 원래의 업스트림 프로젝트에 통합되었으며, rustar-aligner는 원래 프로젝트가 포기되었기 때문에 새로운 커뮤니티 관리 하에 이동했습니다. 기존 유지보수자와의 조정이 가능할 때는 가능한 한 빨리 시작해야 합니다. 별도의 구현이 필요한 경우 명확한 소유자와 신뢰할 수 있는 유지보수 계획이 필요합니다. 그렇지 않으면 오늘날의 현대적인 재작성은 내일의 버려진 코드가 되어 신뢰할 수 있는 과학 인프라가 되지 못할 수 있습니다.

더 지속 가능한 과학 소프트웨어를 향하여

이 필드 보고서는 회고적이고 탐색적이지만, 사례 연구는 과학 소프트웨어가 개발되는 방식에 실질적인 변화를 시사합니다. Codex와 같은 코딩 에이전트는 유지보수, 마이그레이션, 최적화 및 새로운 구현의 비용을 크게 낮출 수 있습니다. 그들의 장기적인 과학적 가치는 여전히 무엇을 구축할지, 어떻게 검증할지, 누가 유지할지를 둘러싼 인간의 결정에 달려 있습니다. 더 깊은 변화는 연구자들이 더 많은 소프트웨어를 생산할 수 있다는 것뿐만 아니라, 그들이 도구를 정의하고, 검증하고, 관리하는 데 더 많은 노력을 기울일 수 있다는 것입니다.

이러한 사례 연구는 에이전트가 이미 과학 컴퓨팅에서 반복의 속도를 가속화할 수 있음을 보여줍니다. 코딩 에이전트가 개선됨에 따라, 연구자들은 분석 파이프라인을 유지하는 데 덜 시간을 할애하고, 그들의 분야를 발전시키는 데 더 많은 시간을 할애할 수 있게 될 것입니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.