파이어크롤(Firecrawl)이 AI 에이전트용 웹 스크래핑 플랫폼 개발을 위해 7500만달러를 조달하고 데이터 통합 서비스 ‘알렉산드리아(Alexandria)’를 출시했다. IT 전문 매체 실리콘앵글은 9월 23일 파이어크롤이 시리즈B 투자 라운드를 마쳤다고 보도했다.
파이어크롤의 AI 에이전트용 웹 데이터 수집
이번 투자는 로스앤젤레스에 기반을 둔 벤처캐피털 스매시벤처스가 주도했으며, Y콤비네이터, 알토스벤처스, 넥서스벤처파트너스, 프리스타일, 오프라인벤처스가 참여했다. 조달한 자금은 웹 데이터 수집 기능을 강화하고 제3자 데이터 제공업체의 정보를 서비스에 추가하는 데 쓰일 예정이다.
파이어크롤은 AI 에이전트가 작업에 필요한 웹페이지를 찾을 수 있도록 에이전트에 최적화된 검색엔진을 제공한다. 검색 결과를 웹페이지 생성 시점이나 포함된 파일 형식 등으로 걸러낼 수 있어 사람을 위한 일반 검색엔진보다 AI 에이전트의 데이터 수집에 효율적이라고 회사는 설명했다. 여러 단계로 로딩되는 웹페이지에 대해서는 ‘스마트 대기’ 기능 덕분에 페이지가 완전히 열리기 전에 내용을 내려받아 발생하는 데이터 오류를 피한다고 파이어크롤은 설명했다.
스크롤이나 버튼 클릭, 양식 제출 뒤에야 표시되는 정보도 자동으로 불러올 수 있다. 개발자는 소프트웨어가 웹페이지에서 어떤 동작을 수행할지 프롬프트로 지정할 수 있으며, PDF와 워드 문서 등 웹사이트에 올라온 파일에서 핵심 정보를 추출하거나 특정 페이지의 변경 사항을 감시하는 기능도 이용할 수 있다. 예를 들어 소프트웨어 서비스 업체가 경쟁사의 제품 가격 페이지 변동을 추적하는 방식이다.
알렉산드리아로 외부 데이터 한곳에서 연결
새로 공개된 알렉산드리아는 웹에서 수집한 정보에 제3자 제공업체의 데이터와 파이어크롤이 직접 선별한 데이터셋을 결합하는 클라우드 서비스다. 데이터셋에는 수천만건 규모의 과학 논문 초록과 이와 비슷한 규모의 코드·기술문서 파일이 각각 포함된다. 프로그래밍 보조 에이전트는 개발자 포럼에서 가져온 코드 예시에 기술 데이터셋의 설명을 덧붙이는 식으로 활용할 수 있다.
여러 출처의 정보를 연결하려면 통상 개발자가 출처마다 별도 커넥터를 구축해야 하지만, 파이어크롤은 알렉산드리아의 데이터가 하나의 API를 통해 제공된다고 설명했다. 파이어크롤은 이를 통해 맞춤형 연결 코드 작성 부담을 줄일 수 있다고 밝혔다. 회사는 조만간 콘텐츠 라이선스를 이용자가 직접 처리할 수 있는 셀프서비스 시스템을 출시해 데이터 제공업체 정보를 추가하는 절차도 앞당길 계획이다. 구체적인 출시일과 이용 요금은 공개되지 않았다.