농촌진흥청, 농생명 특화 거대언어모델 개발해 10월 활용

농촌진흥청이 농생명 분야 논문과 국가 연구 데이터를 학습한 특화 거대언어모델(LLM)을 개발해 10월부터 활용한다. 농촌진흥청은 10월 8일 보도자료에서 답변에 근거와 출처를 함께 제시하고, 기관 내부에서 자료와 계산 과정을 관리해 보안을 강화했다고 설명했다.

논문·연구 데이터 3만2천건 학습

모델 개발을 위해 원예·육종·작물·약용작물·식물병리 분야 5개 학회와 협약을 맺고 학술논문 약 2만편을 확보했다. 농촌진흥청의 국제학술지 논문 1만여편과 연구개발 보고서 약 3000건도 활용했다. 콩·벼·고추 유전형 데이터베이스와 용어집·농업백과 등도 활용했으며, 농생명 연구 데이터는 3만2000건이다.

과거 논문 중 그림으로 저장된 자료는 글자 인식 기술로 문서화했다. 이를 포함해 국·영문 문헌 2만6711편을 정리하고, 질의응답 자료 48만1968건과 풀이 자료 2만9480건을 만들었다. 공개 기반 모델 4종을 농생명 지식에 맞게 미세 조정한 뒤 전문가형 답변을 생성하도록 학습했다. 학습은 도메인 지식을 익히는 단계와 전문가형 응답을 익히는 단계로 진행됐다.

출처 표시·기관 내부 운영

모델은 답변에 관련 논문과 데이터 레코드의 출처를 번호로 표시한다. 콩 개화기 유전자의 최근 국내 연구 동향을 질문하면 관련 국내 논문 12건을 찾아 제시하고, 학회지 논문과 농업생명공학정보센터(나빅)의 유전형 자료 등을 출처로 연결하는 방식이다. 검색에는 벡터 검색과 키워드 검색을 결합한 하이브리드 검색증강생성(RAG)을 적용하고, 나빅 데이터베이스의 원본 레코드를 직접 호출한다.

농촌진흥청은 범용 LLM이 국내 농업 정보를 충분히 다루지 못하고 답변의 근거를 확인하기 어렵다는 점, 민감한 자료를 외부 서비스에 맡기기 어렵다는 점을 개발 배경으로 들었다. 이에 원본 데이터와 검색 인덱스, 훈련 데이터를 분리하고 기관이 자료와 계산 과정을 직접 관리하는 온프레미스 방식으로 구축했다. 농촌진흥청 농업생명자원부 옥현충 부장은 농생명 논문과 데이터로 직접 학습한 전문가 시스템이라며, 기존 농업 AI와 연계해 연구 현장에 필요한 기능을 추가하겠다고 말했다.

이번 모델은 농업인용 ‘AI 이삭이’, 기획·행정 및 연구용 ‘AI 새싹이’에 이은 농촌진흥청의 세 번째 농업 AI다. 나빅에 탑재돼 10월부터 농촌진흥청 연구자를 대상으로 시범 서비스에 들어갔으며, 대국민 서비스는 2027년 1월 시작할 예정이다. 농촌진흥청은 2028년 서비스 제공을 목표로 농생명 연구를 지원하는 에이전트 개발에도 착수할 계획이다.

RELATED ARTICLES

RECOMMENDED STORIES