Baidu가 ‘Unlimited OCR’를 공개하며 방대한 문서 페이지를 한 번에 처리하는 메모리·망각 알고리즘을 도입해, 문서 인텔리전스 기반 사이버·정보전 역량을 고도화함
- The Decoder는 Baidu가 ‘Unlimited OCR’ 시스템을 발표하여 기존 OCR 엔진이 수십 페이지 단위로 나누어 처리해야 했던 PDF와 스캔 문서를 수십·수백 페이지까지 한 번에 인식할 수 있도록 설계했다며, 이 기술이 메모리를 인간의 망각처럼 관리하는 알고리즘을 통해 중요 정보만 유지하고 부차적 픽셀·레이아웃 정보를 버리는 방식으로 연산 효율을 극대화한다고 설명하고, 이를 Baidu Machine Nano Banana Pro 같은 중국발 AI 하드웨어와 결합해 문서 인식 기반 데이터 추출 서비스를 상용화하려는 움직임을 소개한다.
- 기사에 따르면 Baidu Unlimited OCR는 기존 PaddleOCR, Google Vision API, Microsoft Read API 같은 경쟁 기술과 비교해 페이지 수 제한을 사실상 제거하면서도 표·도표·손글씨를 포함한 복잡한 레이아웃을 처리할 수 있도록 설계되었으며, 내부 테스트에서 수십 페이지짜리 행정 문서와 수백 페이지짜리 기술 보고서를 한 번에 처리하는 데 필요한 GPU 메모리 사용량을 기존 대비 크게 줄이는 성능을 보였다고 전한다. 이를 위해 중요 토큰을 우선 유지하고 맥락이 약한 단어·이미지는 메모리에서 제거하는 ‘망각 메커니즘’을 도입한 점이 기술적 차별점으로 소개된다.
- Baidu는 이 기술을 정부·금융·제조 고객에게 제공하는 문서 디지털화·검색 서비스에 적용해 대규모 계약을 추진하고 있으며, 중국 내 공공기관의 아카이브 문서를 자동 분류·검색하는 프로젝트에서 기존 솔루션 대비 약 30% 이상의 처리 속도 향상을 달성한 것으로 알려졌다. 이는 국가 차원에서 축적된 보고서·지침·규정 문서를 자연어 기반으로 재조합해 정책 분석, 법령 정합성 검토, 규제 영향 평가 등 다양한 용도로 활용할 수 있는 기반을 제공한다.
- Unlimited OCR는 국가·기업이 보유한 방대한 종이·PDF 문서를 구조화 데이터로 전환하는 속도를 비약적으로 높여, 사이버 위협 인텔리전스, 규제 분석, 경쟁사 정보 수집 등 다양한 영역에서 ‘문서 인텔리전스’ 경쟁을 심화시킬 것으로 예상된다. 특히 국가 배후 해킹 그룹과 정보기관이 취득한 문서들을 빠르게 분석해 취약 인프라, 결재 라인, 군수 공급망 정보를 추출할 수 있게 되면서, 문서를 기반으로 한 정교한 표적 공격 설계가 쉬워지는 효과도 동반된다.
- 한국 정부는 Baidu와 같은 중국 기업의 문서 인식·AI 분석 역량을 단순 기술 발전으로 볼 것이 아니라, 디지털 주권과 국가 정보전 경쟁의 관점에서 분석해야 하며, 국정 자료·지자체 문서·공공 조달 계약을 포함한 대규모 문서 데이터에 대해 자체 OCR·NLP 기반 분석 체계를 확립하고, 동시에 외국 기업의 클라우드 OCR 서비스에 민감 문서를 업로드하는 행위를 명확히 제한하는 보안 정책을 마련해야 한다.
문서 인식 AI의 도약은 국가·기업의 축적 문서를 전략 자산으로 전환하는 경쟁을 촉발하므로, 한국은 자체 문서 인텔리전스 역량을 구축하고 해외 서비스 의존에 따른 정보 유출 위험을 관리해야 한다.
주요 용어: OCR(이미지·PDF에서 문자를 인식해 텍스트로 변환하는 기술), Unlimited OCR(페이지 수 제한을 최소화한 Baidu의 대규모 문서 인식 엔진), 문서 인텔리전스(대량 문서를 자동 분석해 정책·위험 정보를 추출하는 데이터 분석 영역)
출처: The Decoder