docs: say why starred glosses leave training but stay in the score - #82
Merged
Conversation
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Solo documentación. Entrenamiento y evaluación tratan distinto las 2.178 glosas con asterisco de LSE-Health, parece una incoherencia y no lo es, y no estaba escrito en ningún sitio.
El reparto, verificado contra el tier VAR del ELAN
El prefijo
*marca «slight drift from normal realization, o un signo OOV visualmente muy parecido», y el motivo concreto de cada una vive en un tierVARdentro del bundle de ELAN. Parseado enlazando cada código con su glosa: 2.178 glosas marcadas, 2.178 con código, uno cada una.SIMOCCOUTSHOMPHLAXMANLOCPor qué la asimetría está bien
El entrenamiento las excluye (
health_split.py), siguiendo el consejo de los autores del corpus: son articulaciones distintas de la nominal y emborronan las clases.La evaluación las puntúa todas (
health_words.py:normalizequita el*). Eso hace que la cifra publicada sea la más estricta de las políticas disponibles, no una favorecedora: las 472SIMle piden al modelo la etiqueta de un signo que no se le está enseñando.SIM/OCC/OUTLa cifra publicada es conservadora por ~1,6 puntos frente a un examen justo, y por 5 frente al favorecedor.
Lo que el README ahora prohíbe explícitamente
No "arreglar" la asimetría excluyéndolas también al puntuar. Subiría la cifra sin que el motor mejore, que es la definición de mover la portería. Si alguna vez se cambia: quitar solo
SIM/OCC/OUT, y decirlo al lado del número.El aviso va en los dos sitios — la sección del README y el docstring de
normalize, que es la línea que alguien tocaría sin leerlo.De paso
Las 485
SHOconviene reportarlas aparte cuando se discuta el segmentador: son exactamente los signos cortos y muy coarticulados que un suelo de duración mínima hace aritméticamente irrecuperables, por la cota IoU <= L/F que ya está documentada más abajo.Sin cambios de código ni de comportamiento. 30 tests de Python y 199 de JS en verde.