오픈AI(OpenAI)가 법률 계약 소프트웨어 업체 아이언클래드(Ironclad)와 협력해 업무용 AI 에이전트를 훈련하고, GPT-6 아스트라(Astra)가 계약 관련 연구 과제에서 GPT-5.6 솔(Sol)보다 높은 점수를 냈다고 공개했다. 오픈AI는 10월 6일 자사 블로그에서 아스트라의 평균 점수가 32% 높고 과제당 예상 수행 시간은 48% 짧았다고 밝혔다.
계약 업무 11개 과제로 모델 평가
이번 협력의 초점은 기업의 업무 규칙을 이해하고 여러 단계로 이뤄진 작업을 수행한 뒤, 결과가 처음 요구사항을 충족하는지 확인하는 에이전트 개발이다. 오픈AI는 전문 소프트웨어를 활용해 복잡한 업무를 더 능숙하고 효율적으로 수행하는 에이전트를 연구하고 있다고 설명했다. 아이언클래드는 실제 계약 업무를 잘 아는 소프트웨어 업체와 과제를 정해 모델 훈련·평가에 활용하는 첫 협력사다.
양사는 법무·상업·조달 분야에서 11개 과제를 선정했다. 비밀유지계약 설정, 조달 승인 절차 구성, 요청자가 선택한 관할권에 맞춰 재사용 가능한 법률 조항을 수정하는 작업 등이 포함됐다. 오픈AI는 숙련된 사용자가 과제 하나를 수행하는 데 평균 30~40분이 걸릴 것으로 추산했다. 각 과제는 복잡도에 따라 8~50개 기준으로 평가했다. 개별 단계의 정답 여부뿐 아니라 완성된 절차가 다양한 상황에서도 의도한 규칙대로 작동하는지를 살피기 위한 기준이다.
아이언클래드는 모델이 과제를 연습할 수 있도록 자사 제품의 호스팅 소프트웨어 환경을 제공했다. 연구진은 대표적인 업무 흐름을 바탕으로 합성 훈련 과제를 만들고, 연습과 피드백을 통해 성능을 높이는 강화학습을 적용했다. 평가에서 아스트라의 평균 점수는 55%로 GPT-5.6 솔의 41.6%보다 높았다. 과제당 예상 시간은 솔의 37.0분에서 아스트라의 19.2분으로 줄었다. 오픈AI는 개발에 사용한 내부 모델이 같은 과제에서 63.7%를 기록했으며, 이 성능 향상을 향후 모델에도 반영할 계획이라고 밝혔다.
복잡한 계약 업무에 필요한 검증과 감독
두 모델의 설정은 각 모델이 가장 높은 점수를 낸 추론 단계로 맞췄다. 아스트라는 ‘맥스 추론’, 솔은 ‘하이 추론’ 설정으로 11개 과제를 평가했다. 오픈AI가 별도로 제시한 과제 사례에서는 아스트라가 약 20분 만에 평가 기준의 94%를 충족했고, 솔은 약 32분 동안 85%를 충족했다. 이 사례의 수치는 11개 과제 평균과는 별도로 제시된 특정 작업의 결과다.
계약 절차에는 지출액에 따른 재무 승인, 요청 유형별 보안 검토, 비표준 조항에 대한 법무 검토처럼 업무 규칙과 예외가 함께 들어갈 수 있다. 오픈AI는 에이전트가 작업 중 규칙 하나를 놓치면 소프트웨어 업체가 에이전트에 확신을 갖고 맡길 수 있는 업무가 제한된다며, 복잡한 계약 작업에서도 사람의 감독이 필요하다고 짚었다. 아이언클래드와의 협력은 실제 고객 업무에서 중요한 문제를 모델 개발 단계에 반영하는 데 목적이 있다. 오픈AI는 현재 에이전트가 안정적으로 처리하지 못하는 전문 업무를 함께 연구할 소수의 소프트웨어 업체를 추가로 모집한다고 밝혔다.