Skip to content

docs: say why starred glosses leave training but stay in the score - #82

Merged
Endika merged 1 commit into
mainfrom
docs/starred-gloss-policy
Aug 26, 2026
Merged

docs: say why starred glosses leave training but stay in the score#82
Endika merged 1 commit into
mainfrom
docs/starred-gloss-policy

Conversation

@Endika

@Endika Endika commented Aug 26, 2026

Copy link
Copy Markdown
Owner

Solo documentación. Entrenamiento y evaluación tratan distinto las 2.178 glosas con asterisco de LSE-Health, parece una incoherencia y no lo es, y no estaba escrito en ningún sitio.

El reparto, verificado contra el tier VAR del ELAN

El prefijo * marca «slight drift from normal realization, o un signo OOV visualmente muy parecido», y el motivo concreto de cada una vive en un tier VAR dentro del bundle de ELAN. Parseado enlazando cada código con su glosa: 2.178 glosas marcadas, 2.178 con código, uno cada una.

código n qué es ¿sirve?
SIM 472 otra glosa que solo se le parece no — la etiqueta está mal
OCC 68 signo ocluido no
OUT 18 signo fuera de plano no
SHO 485 signo muy corto, por velocidad y mucha coarticulación sí, y es el caso difícil
MPH LAX MAN LOC 1.129 morfología, ejecución relajada, mano no dominante anómala, ubicación desplazada sí — el signo real, ejecutado distinto

Por qué la asimetría está bien

El entrenamiento las excluye (health_split.py), siguiendo el consejo de los autores del corpus: son articulaciones distintas de la nominal y emborronan las clases.

La evaluación las puntúa todas (health_words.py:normalize quita el *). Eso hace que la cifra publicada sea la más estricta de las políticas disponibles, no una favorecedora: las 472 SIM le piden al modelo la etiqueta de un signo que no se le está enseñando.

política instancias puntuables recall de palabra
todas puntuadas (lo publicado) 1.060 38,1%
quitando solo SIM/OCC/OUT 996 39,7%
quitando todas las marcadas 849 43,1%

La cifra publicada es conservadora por ~1,6 puntos frente a un examen justo, y por 5 frente al favorecedor.

Lo que el README ahora prohíbe explícitamente

No "arreglar" la asimetría excluyéndolas también al puntuar. Subiría la cifra sin que el motor mejore, que es la definición de mover la portería. Si alguna vez se cambia: quitar solo SIM/OCC/OUT, y decirlo al lado del número.

El aviso va en los dos sitios — la sección del README y el docstring de normalize, que es la línea que alguien tocaría sin leerlo.

De paso

Las 485 SHO conviene reportarlas aparte cuando se discuta el segmentador: son exactamente los signos cortos y muy coarticulados que un suelo de duración mínima hace aritméticamente irrecuperables, por la cota IoU <= L/F que ya está documentada más abajo.

Sin cambios de código ni de comportamiento. 30 tests de Python y 199 de JS en verde.

@Endika
Endika enabled auto-merge (rebase) August 26, 2026 22:49
@Endika
Endika merged commit bfe212d into main Aug 26, 2026
7 checks passed
@Endika
Endika deleted the docs/starred-gloss-policy branch August 26, 2026 22:55
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant