PDF 데이터 추출 엔진 ‘오픈데이터로더 PDF’ 보안 위협 자동 감지·차단하는 기능 추가 예정
이미지 확대보기한글과컴퓨터는 인공지능(AI) 학습・활용 과정에서 고질적인 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 전격 공개했다고 17일 밝혔다. / 사진=한컴
[한국금융신문 정채윤 기자] 한글과컴퓨터(이하 한컴)는 인공지능(AI) 학습・활용 과정에서 고질적인 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 전격 공개했다고 17일 밝혔다.
이번에 공개된 ‘오픈데이터로더 PDF’는 한컴이 오랜 기간 축적한 문서 처리 기술력을 바탕으로 개발한 PDF 데이터 추출 엔진이다.
한컴 관계자는 “PDF는 전 세계적으로 AI 학습에 가장 널리 사용되는 문서 형태이지만, 복잡한 내부 구조 때문에 학습용 데이터 추출이 쉽지 않다”며 “이로 인해 ‘데이터 감옥’이라 불릴 만큼 AI 개발 과정에서 큰 제약이 따랐다”고 설명했다.
이에 한컴은 지난 7월 PDF 기술 전문 기업 듀얼랩과 오픈소스 기반 PDF 데이터로더를 공동 개발했다. 공동 개발한 오픈데이터로더 PDF는 PDF 문서 내 텍스트・표・이미지・레이아웃 정보를 높은 정확도와 빠른 성능으로 추출해, AI 학습에 즉시 활용할 수 있는 정형화된 데이터(JSON・Markdown・HTML)로 변환한다.
오픈데이터로더 PDF는 보안 위협을 자동 감지·차단하는 기능을 추가할 예정이다. 이를 통해 AI 학습 데이터의 안정성과 신뢰성을 동시에 보장한다는 구상이다.
한컴은 이번 오픈소스 공개를 단순한 기술 공유에 그치지 않고, AI 생태계 전반의 오픈소스 확산과 기술 고도화를 추진할 계획이다. 이를 위해 챗GPT・제미나이・랭체인 등 주요 AI 프레임워크와의 연동·호환성을 강화하고, 깃허브를 통한 글로벌 개발자 커뮤니티와의 협력을 이어갈 계획이다.
정지환 한컴 최고기술책임자(CTO)는 “AI 트랜스포메이션(AX) 시대, 오픈소스는 더 이상 선택이 아닌 기업과 사회 전반의 혁신과 경쟁력 확보를 위한 필수 전략”이라며 “이번 오픈데이터로더 PDF 핵심 기술 공개를 통해 전 세계 개발자들에게 인정받고, 협력을 통해 PDF 데이터 추출 기술을 한 단계 더 발전시켜 글로벌 최고 수준의 AI 데이터 추출 기술을 완성하겠다”고 말했다.
이어그는 “연말에는 AI 기반문서인식기술을추가하는등오픈소스프로젝트를지속적으로고도화하겠다”고덧붙였다.
(주)한국금융신문은 뉴스레터 구독(이메일 전송) 서비스와 당사 주관 또는 제휴·후원 행사 및 교육에 대한 안내를 위해 이메일주소를 수집합니다.
구독 서비스 신청자는 개인정보 수집·이용에 동의를 거부할 권리가 있습니다. 단, 거부 시 뉴스레터를 이메일로 수신할 수 없습니다.
뉴스레터 수신동의 해제는 뉴스레터 하단의 ‘수신거부’를 통해 해제할 수 있습니다.