Compression et indexation de séquences annotées
Document type :
Thèse
Title :
Compression et indexation de séquences annotées
English title :
Compressing and indexing labeled sequences
Author(s) :
Rocher, Tatiana [Auteur]
Centre de Recherche en Informatique, Signal et Automatique de Lille - UMR 9189 [CRIStAL]
Bioinformatics and Sequence Analysis [BONSAI]
Centre de Recherche en Informatique, Signal et Automatique de Lille - UMR 9189 [CRIStAL]
Bioinformatics and Sequence Analysis [BONSAI]
Thesis director(s) :
Mathieu Giraud
Mikaël Salson
Mikaël Salson
Defence date :
2018-02-12
Jury president :
Lynda Tamine-Lechani [Rapporteuse]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Jury member(s) :
Lynda Tamine-Lechani [Rapporteuse]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Accredited body :
Université de Lille
Doctoral school :
ED SPI 072
Keyword(s) :
Algorithmique du texte
Structure de données
Bioinformatique
Compression de données
Indexation de texte
Transformée de Burrows-Wheeler
Recombinaisons V(D)J
Structure de données
Bioinformatique
Compression de données
Indexation de texte
Transformée de Burrows-Wheeler
Recombinaisons V(D)J
English keyword(s) :
V(D)J recombinations
Wavelet Tree
Burrows-Wheeler transform
Stringology
Data structure
Bioinformatics
Data compressing
Text indexing
Wavelet Tree
Burrows-Wheeler transform
Stringology
Data structure
Bioinformatics
Data compressing
Text indexing
HAL domain(s) :
Informatique [cs]/Bio-informatique [q-bio.QM]
Informatique [cs]/Algorithme et structure de données [cs.DS]
Sciences du Vivant [q-bio]/Immunologie/Immunité adaptative
Informatique [cs]/Algorithme et structure de données [cs.DS]
Sciences du Vivant [q-bio]/Immunologie/Immunité adaptative
French abstract :
Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison ...
Show more >Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison V(D)J, un marqueur de globules blancs, où le texte est une séquence ADN et les annotations sont des noms de gènes. Le système immunitaire d'une personne se représente par un ensemble de recombinaisons V(D)J. Avec le séquençage à haut débit, on peut avoir accès à des millions de recombinaisons V(D)J qui sont stockées et doivent pouvoir être retrouvées et comparées rapidement. La première contribution de cette thèse est une méthode de compression d'un texte annoté qui repose sur le principe du stockage par références. Le texte est découpé en facteurs pointant vers les séquences annotées déjà connues. La seconde contribution propose deux index pour un texte annoté. Ils utilisent une transformée de Burrows-Wheeler indexant le texte ainsi qu'un Wavelet Tree stockant les annotations. Ces index permettent des requêtes efficaces sur le texte, les annotations ou les deux. Nous souhaitons à terme utiliser l'un de ces index pour indexer des recombinaisons V(D)J obtenues dans des services d'hématologie lors du diagnostic et du suivi de patients atteints de leucémie.Show less >
Show more >Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison V(D)J, un marqueur de globules blancs, où le texte est une séquence ADN et les annotations sont des noms de gènes. Le système immunitaire d'une personne se représente par un ensemble de recombinaisons V(D)J. Avec le séquençage à haut débit, on peut avoir accès à des millions de recombinaisons V(D)J qui sont stockées et doivent pouvoir être retrouvées et comparées rapidement. La première contribution de cette thèse est une méthode de compression d'un texte annoté qui repose sur le principe du stockage par références. Le texte est découpé en facteurs pointant vers les séquences annotées déjà connues. La seconde contribution propose deux index pour un texte annoté. Ils utilisent une transformée de Burrows-Wheeler indexant le texte ainsi qu'un Wavelet Tree stockant les annotations. Ces index permettent des requêtes efficaces sur le texte, les annotations ou les deux. Nous souhaitons à terme utiliser l'un de ces index pour indexer des recombinaisons V(D)J obtenues dans des services d'hématologie lors du diagnostic et du suivi de patients atteints de leucémie.Show less >
English abstract : [en]
This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, ...
Show more >This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, the text is a DNA sequence and the labels are the genes' names. A person's immune system can be represented with a set of V(D)J recombinations. With high-throughput sequencing, we have access to millions of V(D)J recombinations which are stored and need to be recovered and compared quickly.The first contribution of this thesis is a compression method for a labeled text which uses the concept of storage by references. The text is divided into sections which point to pre-established labeled sequences. The second contribution offers two indexes for a labeled text. Both use a Burrows-Wheeler transform to index the text and a Wavelet Tree to index the labels. These indexes allow efficient queries on text, labels or both. We would like to use one of these indexes on V(D)J recombinations which are obtained with hematology services from the diagnostic or follow-up of patients suffering from leukemia.Show less >
Show more >This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, the text is a DNA sequence and the labels are the genes' names. A person's immune system can be represented with a set of V(D)J recombinations. With high-throughput sequencing, we have access to millions of V(D)J recombinations which are stored and need to be recovered and compared quickly.The first contribution of this thesis is a compression method for a labeled text which uses the concept of storage by references. The text is divided into sections which point to pre-established labeled sequences. The second contribution offers two indexes for a labeled text. Both use a Burrows-Wheeler transform to index the text and a Wavelet Tree to index the labels. These indexes allow efficient queries on text, labels or both. We would like to use one of these indexes on V(D)J recombinations which are obtained with hematology services from the diagnostic or follow-up of patients suffering from leukemia.Show less >
Language :
Français
Collections :
Source :
Files
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Open access
- Access the document
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Open access
- Access the document
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Open access
- Access the document
- 2018-phd-rocher.pdf
- Open access
- Access the document
- document
- Open access
- Access the document