Pour obtenir des listes de mots de fréquences exceptionnelles par rapport à un modèle aléatoire, par exemple dans un contexte de biologie moléculaire, il faut quantifier la qualité de la prédiction des fréquences d'une famille de mots. Nous étudions les probabilités de grandes déviations du processus vectoriel de comptage d'une famille de mots dans des modèles de Markov et des modèles de Markov cachés. Pour démontrer ces résultats, nous établissont un développement du type Edgeworth sur les fonctionnelles additives d'une chaîne de Markov finie. Nous utilisons les théorèmes obtenus pour produire des listes de mots exceptionnels dans les génomes d'Escherichia Coli et de Bacillus Subtilis par conditionnements successifs d'un modèle statistique initial.
Publié le : 2004-12-16
Classification:
Markov process,
large deviations,
Edgeworth expansions,
Protein and DNA sequences,
hidden Markov models.,
chaînes de Markov cachées,
Processus de Markov,
grandes déviations,
développement de Edgeworth,
séquences d'ADN ou de protéine,
chaînes de Markov cachées.,
[SDV]Life Sciences [q-bio],
[MATH]Mathematics [math]
@article{tel-00008517,
author = {Pudlo, Pierre},
title = {Precise estimates of large deviations with applications to biological sequence analysis},
journal = {HAL},
volume = {2004},
number = {0},
year = {2004},
language = {fr},
url = {http://dml.mathdoc.fr/item/tel-00008517}
}
Pudlo, Pierre. Precise estimates of large deviations with applications to biological sequence analysis. HAL, Tome 2004 (2004) no. 0, . http://gdmltest.u-ga.fr/item/tel-00008517/