Integrating large language models with clinical radiology scans requires precise spatial grounding. Unlike natural image captioning where loose associations suffice, radiological AI diagnostic assistants must pinpoint subtle nodules and micro-calcifications referenced in clinical text reports. Here we detail our contrastive alignment framework bridging DICOM pixel representations with medical terminology embeddings.