FAIR-compliant receptor–ligand data GMMSB / LNCC

2026-07-0

DockTData

Structure and bioactivity, connected for discovery.

A FAIR-compliant dataset of receptor–ligand binding complexes for computational modeling and drug discovery.

Dataset at a glance

24,719

Unique complexes

Assembly–ligand pairs

11,742

Distinct ligands

Unique InChIKeys

271

Protein–peptide complexes

Peptide ligand class

70

Protein–oligosaccharide complexes

Oligosaccharide ligand class

Curated for modern molecular research.

DockTData brings structural and energetic records into one consistent, research-ready foundation. Explore the dataset.

01

FAIR-compliant

Findable, accessible, interoperable, and reusable data practices support transparent open science.

02

Bioactivity parameters

Ki, Kd, IC50, and EC50 values use normalized units for consistent comparison across experiments.

03

Machine-learning ready

Structured records support predictive modeling and deep-learning workflows without unnecessary preparation overhead.

04

Multi-source integration

Protein Data Bank, BindingDB, and ChEMBL records are brought together through a reproducible pipeline.

05

Quality validated

Preparation and validation criteria help maintain reliable structural and experimental relationships.

06

Discovery focused

The dataset supports rational drug design, virtual screening, and broader molecular-modeling studies.

Bridging structure and bioactivity.

DockTData is an automated extract, transform, and load pipeline designed to connect structural biology with molecular energetics.

Experimental structures from the Protein Data Bank are synchronized with bioactivity data from BindingDB and ChEMBL. The resulting receptor–ligand records are prepared for scalability, reproducibility, and use across machine-learning and molecular-modeling studies.

Dataset archive 2026-07-0 · 11.6 GB
Archive path /downloads/snapshot_v2026-07-0/snapshot_v2026-07-0.zip
SHA-256 2f16d796072aafa378195daba87ed3f8fdc4ea9a974c6e326d3fd686cfbf53b9
License CC BY-SA 4.0

Scientific infrastructure, built in Brazil.

The Grupo de Modelagem Molecular de Sistemas Biológicos at Laboratório Nacional de Computação Científica develops computational tools for molecular modeling and drug discovery research.

Visit GMMSB
GMMSB The molecular-modeling research group behind DockTData.
LNCC Based within Brazil's National Laboratory for Scientific Computing.

Bring DockTData into your research.

Start with the dataset or contact the team to discuss its preparation and use.

Download dataset

Use DockTData in your work.