Intern-S2-Preview: Scientific Agentic Foundation Model
과학적 발견은 이질적인 양식의 과학적 증거를 추론하고, 과학 도구 및 환경과 상호작용하며, 장기적인 과제를 지속할 수 있는 AI 시스템을 요구합니다. 이에 따라 본 논문은 다중 모드 과학적 이해, 추론, 생성 및 장기 과제 수행을 지원하도록 설계된 과학 에이전트 파운데이션 모델인 Intern-S2-Preview를 제시합니다.
모델 훈련 파이프라인은 렌더링된 과학 문서, 이미지-텍스트 데이터, 다양한 과학 코퍼스를 활용한 과학 다중 모드 사전 훈련으로 시작됩니다. 사전 훈련된 체크포인트에서 시작하여 지도 미세 조정, 확장 가능한 다중 작업 강화 학습(RL), 블랙박스 및 화이트박스 에이전트 RL, 온-폴리 디스틸레이션으로 구성된 통합 후 훈련 파이프라인을 적용합니다. 이 과정에서는 부분 롤아웃과 오프-폴리 보정을 통한 안정성 및 효율성 개선을 위해 적응형 길이 정규화, 온라인 추측 디코딩, 견고한 다중 작업 최적화 등의 실용적인 기술이 지원됩니다.
아키텍처 수준에서 Intern-S2-Preview-397B는 효율적인 장 시퀀스 이해에서 수치 예측으로 시간 시리즈 모델링을 확장하며, 별도의 메모리 증강 경로인 Memory Decoder를 통해 고정된 397B 백본을 수정하지 않고도 빠른 과학적 전문화를 가능하게 합니다. 이러한 확장 모델은 과학, 다중 모드, 에이전트 및 일반 목적 벤치마크 전반에서 경쟁력 있거나 선도적인 결과를 달성했습니다. 특히 시간 시리즈 모듈은 SciTS에서 과학적 신호 이해와 예측을 개선했으며, Intern-MemDec-4B 확장 모델은 백본을 변경하지 않고 Biology-Instructions 평균 점수를 56.92점에서 60.32점으로 향상시켰습니다.
모델 훈련 파이프라인은 렌더링된 과학 문서, 이미지-텍스트 데이터, 다양한 과학 코퍼스를 활용한 과학 다중 모드 사전 훈련으로 시작됩니다. 사전 훈련된 체크포인트에서 시작하여 지도 미세 조정, 확장 가능한 다중 작업 강화 학습(RL), 블랙박스 및 화이트박스 에이전트 RL, 온-폴리 디스틸레이션으로 구성된 통합 후 훈련 파이프라인을 적용합니다. 이 과정에서는 부분 롤아웃과 오프-폴리 보정을 통한 안정성 및 효율성 개선을 위해 적응형 길이 정규화, 온라인 추측 디코딩, 견고한 다중 작업 최적화 등의 실용적인 기술이 지원됩니다.
아키텍처 수준에서 Intern-S2-Preview-397B는 효율적인 장 시퀀스 이해에서 수치 예측으로 시간 시리즈 모델링을 확장하며, 별도의 메모리 증강 경로인 Memory Decoder를 통해 고정된 397B 백본을 수정하지 않고도 빠른 과학적 전문화를 가능하게 합니다. 이러한 확장 모델은 과학, 다중 모드, 에이전트 및 일반 목적 벤치마크 전반에서 경쟁력 있거나 선도적인 결과를 달성했습니다. 특히 시간 시리즈 모듈은 SciTS에서 과학적 신호 이해와 예측을 개선했으며, Intern-MemDec-4B 확장 모델은 백본을 변경하지 않고 Biology-Instructions 평균 점수를 56.92점에서 60.32점으로 향상시켰습니다.