This project processes NCCN (National Comprehensive Cancer Network) guidelines and creates a searchable vector index using FAISS.
- Install dependencies:
pip install -r requirements.txt- Create a
.envfile with your OpenAI API key:
OPENAI_API_KEY=your_api_key_here
project/
├── nccn_guidelines/ # Place your NCCN PDF files here
├── nccn_index/ # Output directory for FAISS index and metadata
├── requirements.txt # Project dependencies
├── process_nccn_guidelines.py # Main processing script
└── README.md # This file
- Place your NCCN guideline PDF files in the
nccn_guidelinesdirectory - Run the processing script:
python process_nccn_guidelines.pyThe script will:
- Process each PDF file
- Split text into chunks
- Generate embeddings using OpenAI
- Create a FAISS index
- Save metadata for each chunk
The script will generate:
nccn_index.faiss: The FAISS vector indexmetadata.json: Metadata about each text chunk including source file and position