1 Lematizador Morfosintáctico con Estimador Idiomático y Flexionador para idiomas muy flexivos como el Español Andrés Tomás Hohendahl 1 José Francisco Zelasco 1,2 1 Lab. de Estereología y Mecánica Inteligente Facultad de Ingeniería, U.B.A. 2 INTIA Facultad de Ciencias Exactas, UNCPBA El problema de la desambiguació morfosintàctica: un enfocament d’aprenentatge automàtic basat en arbres de decisió Aplicació de tècniques d’aprenentatge automàtic al problema de la desambiguació morfosintàctica
2 Guión de la presentaciónIntroducción Ingeniería y Lingüística Lenguajes y Diccionarios Reglas Morfológicas y Compresión Estructuras Eficientes de Búsqueda Aplicaciones Conclusiones Introduction: marc general i la motivació d’aquest treball
3 Introducción Interfaz Hombre-MáquinaObjetivo: Reducir la brecha de interacción Métodos: Reconocimiento+Síntesis Habla Voz a Texto Escritura Óptica (cámara/scanner) Gráfica-Gestual (Lapicera Electrónica) Tablet-PC, PDA Firma Manual-Electrónica (Seguridad) Visión Biometría (Seguridad de Acceso) Reconocimiento de Gestos (Diálogo) Retroalimentación Visual: Displays Mecánica: Accionamientos, Robótica, etc. Auditiva: Síntesis de Habla (TTS: Text-To-Speech)
4 Introducción Reconocimiento de Escritura y Habla Texto como resultado ¿Qué se hace con el texto? Accionamientos Sistema de órdenes Fijas (palabras/secuencias) Seguridad (palabras claves) Responder Preguntas Solicitar Servicios, Dialogar.. Pero es necesario primero: Procesarlo…
5 Ingeniería y LingüísticaProcesar Texto Lingüísticamente Segmentación (Tokenización) Reconocimiento del Idioma Etiquetado Linguïstico y Morfosintáctico Procesamiento Gramatical y Semántico Etiquetado funcional: POS Tagging Parsing: Shallow/Deep Reconocimiento de Entidades (NER) Extracción y Recuperación de Información Sumarización, Clasificación Comprensión de Texto / Inteligencia Artificial
6 Ingeniería y LingüísticaProcesar Texto Lingüísticamente Segmentación (Tokenización) Autómatas Finitos Expresiones Regulares Parsers / Compiladores: Lex / Yacc / Bison / Antlr Métodos Míxtos 3 Parsers + Algoritmos (con Aprox. Sucesivas) Segmentación Estadística Máxima Entropía/Markov/SVM/ID3/Redes Neuronales/etc.
7 Ingeniería y Lingüística- Segmentación de Palabras (Tokenización) Método Usado = Reconocimiento Mixto con Parser 3 Lex-CS: adaptación de LEX a CSharp (C#) Gramática (LEX) Parser en nativo en C# 3 Reconocimiento directo de GRUPOS de símbolos: Números (Formatos Entero y Punto Flotante) Locuciones Españolas (x Tabla) Expansión de Abreviaturas Números (Ordinales / Cardinales / Con Palabras ) Fechas / Horas / Monedas (inglés y español) Unidades Internacionales (Fisicas/Matemáticas/etc.)
8 Lenguajes y DiccionariosReconocimiento del Idioma Estadísticos Rápidos (pocas cuentas) Diccionarios Chicos ~5kb/idioma Buen Reconocimiento >95% Reduce Búsquedas Erradas Estado del Arte en 2004 • Hohendahl, A.T. Zelasco, J.F. WICC 2006 (art.694) Otros Métodos Propietarios (MS, etc.) Fuerza Bruta (costoso) • Padró, Lluís/Munsa. TALP 2004 UPC
9 Lenguajes y DiccionariosDiccionarios y Lenguas Inglés (Poco Flexivo) 80k palabras+flexiones Español (Muy Flexivo) 300M palabras+flexiones Métodos Directos (SQL/Trees/Hashing) Estadísticos / Clasificación Automática (SVM./Markov/MaxEnt./NeuralNet/ID3) Mixtos Reglas: Morfológico/Flexivas
10 Lenguajes y DiccionariosDetección de Léxico (metas) Mínima cantidad de datos almacenados Obtener Información Gramatical y Semántica Tolerar Errores y/o sugerir correcciones Hacerlo Eficientemente Método Usado Almacenar c/Lema con las Reglas Aplicables Cada Regla contiene info. Gramática y Semántica Estructuras de Datos Adecuadas (Trie y Tst) Algoritmo de Búsqueda/Lematización
11 Estructuras EficientesSQL / TSQL (alto nivel) ineficiente para búsquedas parciales Costoso en recursos, mantenimiento y licencias Binary Trees, M-Trees, Radix-Trees ineficientes para búsquedas parciales 3 Trie’s y TST Búsqueda en tiempo lineal Flexibles y Útiles para detección de errores Halla fácilmente por Rangos y Similitud Combinables, Modificables y Flexibles.
12 Reglas Morfológicas y CompresiónUsadas como base de compresión junto a estructuras adecuadas, sirven para realizar búsquedas muy eficientes Algoritmo de Lematización Si la Palabra está en Raíces hallada! Acumular en [verPrefijos] Para cada Regla de Sufijación si es aplicable, quitar sufijo ? Está en Raices hallada = fin! Sino, acumular en [verPrefijos] Para Cada Palabra en [verPrefijos] Para cada Regla de Prefijación si es aplicable, quitar prefijo
13 Reglas Morfológicas y CompresiónEspañol (lengua muy flexiva) Reconocedor (compresión ASPELL Mejorada) ~ Reglas de Flexión ~ 250 Clases (Semánticas+Gramáticas) ~ Palabras Básicas (Lemas) ~ 200 kb (ES_es.zip) ASPELL.org Diccionario libre (GNU) > palabras reconocibles exactamente + Metaphone-Español (Sound-Like) + Matching-Parcial / Corrección de Errores + Info.Estadística (~30kb) + Word-Distance (Says-like) > palabras estimables
14 Aplicaciones Puntos DestacadosLa Acumulación de Características en cada Hallazgo (prefijo y sufijo) entregan la “historia de armado de la palabra” y esto no es más que la información de flexión y semántica buscada. Durante la búsqueda, por usar TST se acumulan palabras “similares” para sugerir o reemplazar en caso de no poder reconocerla y poder crear alternativas por contexto. Se creó una variante de TST para búsqueda parcial, independiente de acentos, díeresis y eñes. Adherimos al formato de Etiquetas EAGLES (Parole2.0) pero lo extendimos para incluir información alguna semántica. Usamos y enriquecimos un formato abierto de diccionarios, (Open-Office) y otro de reglas ortográficas (ASpell/ISpell).
15 Aplicaciones Puntos Destacados (con’t)El Motor de Flexión puede flexionar cualquier palabra, conforme a las reglas estipuladas. Agregamos un mecanismo estadístico+determinístico para estimar palabras por morfología similar (sufijos). Portamos un Parser-Generator (LEX) a C# Reconocemos: Abreviaturas (RAE), Locuciones, Numeros en formatos Numérico y coloqual, Fechas, Monedas, palabras mal acentuadas, y aproximadas. Creamos una variante española de double-Metaphone para búsquedas por similitud acústica (Sound-Like). Ideamos un algoritmo de distancia Fónica (experimental).
16 Conclusiones Combinando estructuras de datos especiales con los algoritmos adecuados, hemos logrado un simple lematizador/flexionador multilingual genérico y robusto con bajo uso de recursos. La plataforma C# usada, ofrece características necesarias para obtener buenos resultados en el laboratorio, aplicables a productos reales.
17 Futuras Líneas de TrabajoInterfaz hombre-Máquina Modelos Cognitivos Modelo de Objetos Gramático-Semántico Resolución de Concordancia y Anáfora en Contexto Definición de un Run-Time Cognitivo Gramática, Sintaxis y Semántica Española Definición en BNF + extenciones. Compilación de Lenguaje Natural Shallow Parser (Estadístico-Heurístico). Nuevo Parser GLR de Español (Tomita). Restricción Semántica bajo Contexto.
18 Andrés T. Hohendahl [email protected]El problema de la desambiguació morfosintàctica: un enfocament d’aprenentatge automàtic basat en arbres de decisió Aplicació de tècniques d’aprenentatge automàtic al problema de la desambiguació morfosintàctica