Los veredictos internos siguen a la evidencia: una lectura neutrosófica con control de plantilla de los estados epistémicos en grandes modelos de lenguaje mediante la lente jacobiana
Palabras clave:
Lógica Neutrosófica, Conjuntos Neutrosóficos De Valor Único, Grandes Modelos De Lenguaje, Interpretabilidad Mecanística, Lente Jacobiana, Auditoría Epistémica, Control De Plantilla.Resumen
Durante veinticinco años, la lógica neutrosófica [1, 2, 3] ha asignado grados independientes de verdad (T), indeterminación (I) y falsedad (F) para modelar estados epistémicos que las semánticas clásica y difusa no pueden expresar. Sin embargo, todas las aplicaciones previas midieron estos componentes sobre salidas: respuestas, juicios, evaluaciones de expertos. Este trabajo reporta, hasta donde conocemos, la primera medición de componentes neutrosóficos en el interior de las representaciones de un gran modelo de lenguaje. Usando la lente jacobiana recientemente publicada [9] sobre Qwen3.5-4B, proyectamos las lecturas de capas intermedias sobre lexicones de apoyo, refutación y cobertura (hedging), obteniendo perfiles (T, I, F) por capa bajo tres condiciones epistémicas (evidencia conflictiva, creencia falsa en primera persona y control factual; n = 20 cada una). Una primera batería arrojó tres firmas llamativas: una oleada de masa de refutación bajo conflicto, indeterminación sostenida bajo creencia falsa y un aparente "colapso del veredicto" antes de la capa de salida. Una segunda batería, con control de plantilla, mostró que las tres, tal como se formularon inicialmente, eran en gran medida artefactos de la gramática del prompt: plantillas idénticas con evidencia concordante inflan las mismas masas de lexicón, las creencias verdaderas provocan la misma cobertura, y el modelo verbaliza su veredicto cuando se le permite generar (17/20 ítems). Lo que sobrevive a los controles es más fuerte que lo que murió: el balance neutrosófico del veredicto B = log10(F) − log10(T) sigue la polaridad de la evidencia bajo plantillas idénticas (separación de unos 3 órdenes de magnitud, d de Cohen = 2.3–2.5, p < 10−6 en 9 de 9 capas; clasificación correcta por ítem de 18/20 y 17/20), y discrimina residualmente las creencias falsas de las verdaderas en primera persona (p < 2 × 10−4 en todas las capas). Sostenemos que la independencia de los componentes neutrosóficos — el axioma que distingue a la neutrosofía de los marcos difuso y clásico — es precisamente lo que hace posibles esta medición y su autocorrección, y destilamos el diseño de dos baterías en un protocolo reutilizable para la auditoría neutrosófica de los estados internos de modelos de lenguaje.
Publicado
Número
Sección
Licencia
Derechos de autor 2026 Neutrosophic Computing and Machine Learning

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.
