Deep stochastic sentence generation : resources and strategies

Mille, SimonWanner, LeoUniversitat Pompeu Fabra. Departament de Tecnologies de la Informació i les Comunicacions2024-03-162024-03-162014-10-142014-10-142014-07-25http://hdl.handle.net/10230/22722The present Ph.D. thesis addresses the problem of deep data-driven Natural Language Generation (NLG), and in particular the role of proper corpus annotation schemata for stochastic sentence realization. The lack of multilevel corpus annotation has prevented so far the development of proper statistical NLG systems starting from abstract structures. We first detail a methodology for annotating corpora at different levels of linguistic abstraction (namely, semantic, deep-syntactic, surface-syntactic, topological, and morphological levels), and report on the actual annotation of such corpora, manually for Spanish and automatically for English. Then, using the resulting annotated data for our experiments, we train and evaluate deep stochastic NLG tools which go beyond the current state of the art, in particular thanks to the absence of rules in non-isomorphic transductions. Finally, we show that such data can also serve well other purposes such as statistical surface and deep dependency parsing.La presente tesis aborda el problema de la generación de textos partiendo desde estructuras profundas; se examina especialmente el papel de un esquema de anotación apropiado para la generación estadística de oraciones. La falta de anotación en varios niveles ha impedido hasta ahora el desarrollo de sistemas de generación estadística desde estructuras abstractas. En primer lugar, se detalla la metodología para anotar corpus en varios niveles (representaciones semánticas, sintácticas profundas, sintácticas superficiales, topológicas y morfológicas), y se presenta su proceso de anotación, manual para el español, y automático para el inglés. Posteriormente, se usan los datos anotados para entrenar y evaluar varios generadores de textos que van más allá del estado del arte actual, en particular porque no contienen reglas para transducciones no isomórficas. Por último, se muestra que estos datos se pueden utilizar también para otros objetivos tales como el análisis sintáctico estadístico de estructuras superficiales y profundas.Programa de doctorat en Tecnologies de la Informació i les Comunicacions326 p.application/pdfapplication/pdfengL'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by-nc-nd/3.0/es/http://creativecommons.org/licenses/by-nc-nd/3.0/info:eu-repo/semantics/openAccessDeep stochastic sentence generation : resources and strategiesinfo:eu-repo/semantics/doctoralThesisCorpusAnnotationDependencyMultilevelResource creationNatural Language ProcessingNLPNatural Language GenerationNLGText generationData-drivenMachine LearningSyntaxSemanticsMorphologyMorpho-syntaxAnnotation methodologyAnnotation criteriaAnnotation toolsGraph transductionSpanishEnglishParsingMeaning-Text TheoryMTTAnCoraAnotaciónDependenciasMultinivelCreación de recursosProcesamiento del Lenguaje NaturalPLNGeneración de Lenguaje NaturalNLGGeneración profundaGeneración de textosEstadísticoAprendizaje automáticoSintáxisSemánticaMorfologíaMorfo-sintáxisMetodología de anotaciónTransducción de grafosEspañolInglésAnálisis sintácticoTeoría Sentido-TextoTST62