임상 문헌은 제약 연구의 생명선이지만 가장 큰 병목 현상 중 하나이기도 합니다. 즉, 인간 전문가가 촘촘한 서술, 표, 그림을 검색하므로 시험 출판물에서 구조화된 통찰력을 추출하려면 몇 주 동안의 수동 검토가 필요할 수 있습니다.
우리는 상위 20개 제약 제조업체와 협력하여 이 프로세스를 재구상하기 시작했습니다. 이러한 점에서 우리 플랫폼은 AI를 도우미로서뿐만 아니라 임상 정보를 구문 분석하고 구조화하기 위한 변환 계층으로 적용하도록 구축되었습니다.
지난 5년 동안의 우리의 여정은 전통적인 규칙 기반 NER에서 다중 모드 기능을 갖춘 LLM 기반 에이전트로 NLP의 광범위한 진화를 반영합니다. 이 블로그에서는 도전과제, 아키텍처 변화, 측정 가능한 이점, 그 과정에서 얻은 교훈 등 진화 과정을 공유합니다.
1단계에서 추출 파이프라인은 약물 이름, 연구 종점, 환자 코호트와 같은 임상 시험 개체를 인식하도록 훈련된 맞춤형 Spacy 기반 NER 모델에 의존했습니다.
특히 아키텍처에는 다음이 포함되었습니다.
그러나 몇 가지 과제가 나타났습니다.
그 결과 성능은 다음과 같았습니다.
범위가 제한되어 있지만 이 단계에서는 구조화된 데이터 파이프라인의 토대를 마련했으며 자동화가 인간 검토자를 의미 있게 강화할 수 있음을 보여주었습니다.
GPT의 등장은 변곡점을 의미했습니다. 결과적으로 몇 번의 프롬프트 기반 추출을 위해 API를 활용하여 엄격한 교육 파이프라인을 우회했습니다.
그 결과 몇 가지 사항이 변경되었습니다.
이로 인해 측정 가능한 영향이 발생했습니다.
전반적으로 이것은 좁은 모델이 아닌 적응형 엔진으로서의 LLM에 대한 첫 번째 맛이었습니다.
직접 LLM 통화는 효과가 있었지만 프로덕션 규모에서는 오케스트레이션이 매우 중요했습니다. 따라서 우리는 워크플로우 관리를 위해 LangChain을 도입했고 나중에는 스키마 시행을 위해 Kor를 도입했습니다.
엔지니어링 혁신:
영향:
일회성 모델 실험이 아닌 처음으로 생산급 신뢰성을 달성했습니다.
임상 문헌은 서로 다른 출처에 걸쳐 맥락적 단편에 의미를 숨기는 경우가 많습니다. 이 문제를 해결하기 위해 우리는 벡터 데이터베이스에 말뭉치를 내장하여 RAG 기반 컨텍스트를 모델 프롬프트에 주입할 수 있도록 했습니다.
아키텍처 하이라이트:
결과:
본질적으로 RAG를 사용하면 모델은 추측이 아닌 지식을 바탕으로 “생각”할 수 있습니다.
오늘날 우리의 애플리케이션은 다양한 데이터 형식과 임상 영역에 대한 전문 자율 단위인 다중 에이전트 시스템을 사용합니다.
특징:
지금 가능한 것:
성능:
현재 이 플랫폼은 단순한 추출 엔진이 아닌 도메인 인식 연구 보조자 역할을 합니다.
앞으로 미래는 실시간 다중 모드 임상 인텔리전스 파이프라인에 있습니다.
결론적으로 로드맵은 추출부터 해석까지, 정적 보고서부터 동적 임상 인텔리전스까지 명확합니다.
작성자 메모: 이 기사는 AI 기반 연구 및 글쓰기로 지원되었으며 Claude 4.4는 텍스트 및 이미지 생성을 지원했습니다.
원래 게시 날짜 CapeStart.com
Recent Comments