Le format mmCIF (Macromolecular Crystallographic Information File) est un format de fichier standard basé sur du texte, largement utilisé en biologie structurale pour représenter et échanger des données sur la structure des macromolécules. Il s'agit d'une extension du format CIF (Crystallographic Information File), plus général, spécifiquement adapté aux macromolécules biologiques telles que les protéines, les acides nucléiques et leurs complexes, déterminés par des techniques telles que la cristallographie aux rayons X, la spectroscopie RMN et la cryo-microscopie électronique. Contrairement aux anciens formats à colonnes fixes comme le format PDB d'origine, le format mmCIF est auto-descriptif, hiérarchique et flexible. Les éléments de données sont identifiés par des noms uniques (balises) précédés d'un tiret bas (par exemple, _atom_site.label_atom_id), ce qui rend le fichier lisible par l'homme et analysable par machine sans nécessiter de dictionnaires externes. Le format prend en charge des structures de données complexes, y compris des tableaux (boucles), et permet l'inclusion de métadonnées étendues au-delà des simples coordonnées atomiques, telles que les détails expérimentaux, les statistiques d'affinement, les informations sur les ligands et les détails de l'assemblage biologique. Le format mmCIF a été développé par l'Union internationale de cristallographie (IUCr) et constitue le format principal utilisé par la Protein Data Bank mondiale (wwPDB) pour l'archivage et la distribution des données structurelles. Son adoption garantit l'intégrité des données, facilite le traitement automatisé et favorise l'interopérabilité entre divers logiciels de biologie structurale. Il répond à de nombreuses limitations du format PDB historique, fournissant un cadre plus robuste et extensible pour la complexité croissante des structures macromoléculaires et des données expérimentales associées. Sa flexibilité lui permet d'évoluer avec les nouvelles techniques expérimentales et les nouveaux types de données.