Logo des Robert Koch-InstitutLogo des Robert Koch-Institut
Publikationsserver des Robert Koch-Institutsedoc
de|en
Publikation anzeigen 
  • edoc Startseite
  • Artikel in Fachzeitschriften
  • Artikel in Fachzeitschriften
  • Publikation anzeigen
  • edoc Startseite
  • Artikel in Fachzeitschriften
  • Artikel in Fachzeitschriften
  • Publikation anzeigen
JavaScript is disabled for your browser. Some features of this site may not work without it.
Gesamter edoc-ServerBereiche & SammlungenTitelAutorSchlagwortDiese SammlungTitelAutorSchlagwort
PublizierenEinloggenRegistrierenHilfe
StatistikNutzungsstatistik
Gesamter edoc-ServerBereiche & SammlungenTitelAutorSchlagwortDiese SammlungTitelAutorSchlagwort
PublizierenEinloggenRegistrierenHilfe
StatistikNutzungsstatistik
Publikation anzeigen 
  • edoc Startseite
  • Artikel in Fachzeitschriften
  • Artikel in Fachzeitschriften
  • Publikation anzeigen
  • edoc Startseite
  • Artikel in Fachzeitschriften
  • Artikel in Fachzeitschriften
  • Publikation anzeigen
2024-05-24Zeitschriftenartikel
Interpretable molecular encodings and representations for machine learning tasks
Weckbecker, Moritz
Anžel, Aleksandar
Yang, Zewen
Hattab, Georges
Molecular encodings and their usage in machine learning models have demonstrated significant breakthroughs in biomedical applications, particularly in the classification of peptides and proteins. To this end, we propose a new encoding method: Interpretable Carbon-based Array of Neighborhoods (iCAN). Designed to address machine learning models' need for more structured and less flexible input, it captures the neighborhoods of carbon atoms in a counting array and improves the utility of the resulting encodings for machine learning models. The iCAN method provides interpretable molecular encodings and representations, enabling the comparison of molecular neighborhoods, identification of repeating patterns, and visualization of relevance heat maps for a given data set. When reproducing a large biomedical peptide classification study, it outperforms its predecessor encoding. When extended to proteins, it outperforms a lead structure-based encoding on 71% of the data sets. Our method offers interpretable encodings that can be applied to all organic molecules, including exotic amino acids, cyclic peptides, and larger proteins, making it highly versatile across various domains and data sets. This work establishes a promising new direction for machine learning in peptide and protein classification in biomedicine and healthcare, potentially accelerating advances in drug discovery and disease diagnosis.
Dateien zu dieser Publikation
Thumbnail
1-s2.0-S2001037024001818-main.pdf — PDF — 1.032 Mb
MD5: 91e90153c1497526dd91770bcbfaa760
Zitieren
BibTeX
EndNote
RIS
(CC BY 3.0 DE) Namensnennung 3.0 Deutschland(CC BY 3.0 DE) Namensnennung 3.0 Deutschland
Zur Langanzeige
Nutzungsbedingungen Impressum Leitlinien Datenschutzerklärung Kontakt

Das Robert Koch-Institut ist ein Bundesinstitut im

Geschäftsbereich des Bundesministeriums für Gesundheit

© Robert Koch Institut

Alle Rechte vorbehalten, soweit nicht ausdrücklich anders vermerkt.