← Artículos

Le pedí a mi sistema que se calificara solo y falló 9 de 10

· 6 min de lectura

De las diez últimas predicciones que cerró mi sistema, nueve fueron inversiones: puntuación alta y rendimiento real por debajo del promedio del canal, con una media de 0,65x. Al abrirlo encontré que buena parte del fallo no estaba en la rúbrica sino en el baseline: el canal tiene dos carriles con medianas de 15.839 y 86.772 visitas, y medir el pequeño contra la mezcla de los dos lo condena a salir mal por construcción.

El número que no quería ver

Mi sistema de contenido tiene una regla que me impuse hace meses: antes de grabar nada, la idea pasa por una rúbrica de 0 a 100, y esa nota se escribe en una base de datos con fecha, antes de publicar. No después. Antes. La razón es simple: si apunto la predicción después de ver el resultado, no estoy midiendo, estoy contándome un cuento. Un sistema que no puede reprobarse a sí mismo no es un sistema de medición, es un espejo. Esta madrugada cerré una predicción vieja y aproveché para mirar el marcador acumulado. De las diez últimas predicciones cerradas, nueve son inversiones: nota alta —80 o más, o sea "esto va a funcionar"— y rendimiento real por debajo del promedio del canal. La media de rendimiento real de esas diez es 0,65x. Traducido: mi sistema acierta menos que tirar una moneda, y encima falla siempre para el mismo lado.

La autopsia

Lo primero que hice fue lo que hace todo el mundo: culpar a la rúbrica. Es lo cómodo. La rúbrica puntúa cosas como la fuerza del gancho, si el dato está verificado, si el ángulo está saturado. Si nueve de diez salen al revés, la rúbrica está rota, ¿no? Pues no del todo. Cuando abrí el cálculo, encontré algo más incómodo. El rendimiento real no es un número absoluto: es un cociente. Divides las visitas del video entre el promedio del canal en los treinta días anteriores. Ese denominador es la vara. Y la vara estaba midiendo dos cosas distintas como si fueran una. Mi canal tiene, en la práctica, dos carriles de tamaño muy distinto:

  • Los videos de nicho —herramientas, configuraciones, cosas para gente que ya trabaja con esto—: mediana de 15.839 visitas sobre 47 piezas.
  • Un carril masivo, de tema mucho más amplio: mediana de 86.772 visitas sobre 12 piezas.

5,5 veces de diferencia. Y el promedio del canal los mete a los dos en la misma bolsa. O sea que cada vez que mido una pieza de nicho contra "el promedio del canal", la estoy comparando contra una vara inflada por doce videos que juegan otro deporte. No es que la pieza rinda mal. Es que la vara no es suya.

Este sistema es el que enseño dentro de la comunidad MÁQUINA IA: las estaciones, los gates y el código que lo sostiene.

Por qué esto importa más de lo que parece

Un número que siempre sale mal deja de ser información. Si mi sistema me dice "por debajo del promedio" pase lo que pase, ya no me está diciendo nada: es ruido con decimales. Y hay una trampa peor. Cuando un indicador está roto hacia abajo, la reacción natural es cambiar lo que estás midiendo, no cómo lo mides. En mi caso eso significaría abandonar el carril de nicho —el que me trae a la gente que de verdad me interesa— porque "los números dicen que no funciona". Los números no dicen eso. Los números dicen que estoy dividiendo por el denominador equivocado. He visto a gente cerrar líneas de trabajo enteras por esto.

Lo que voy a cambiar

Tres cosas, y las escribo aquí para que quede constancia y me las puedas reclamar:

  1. Un baseline por carril. Cada pieza se compara contra la mediana de las piezas de SU carril, no contra la mezcla. Es una línea de código y llevaba meses sin hacerla porque el número global era más cómodo de calcular.
  2. La mediana, no el promedio. Con doce piezas que multiplican por cinco al resto, el promedio no describe a nadie. La mediana aguanta mejor los extremos.
  3. Volver a cerrar las predicciones viejas con la vara corregida, y publicar si el marcador cambia. Si con el baseline bueno siguen siendo nueve inversiones de diez, entonces sí, el problema es la rúbrica y toca reescribirla.

El dato honesto

No sé todavía cuál de las dos cosas pesa más. Puede que corrigiendo la vara el marcador pase de 9 inversiones a 4, y puede que se quede en 8. No lo he medido, así que no te lo voy a vender. Lo que sí sé es esto: durante semanas mi sistema me estuvo dando una nota mala todos los días, yo la estaba leyendo como "el contenido no funciona", y una parte de esa nota era un error de aritmética que yo mismo había dejado ahí. Si tienes un panel que siempre te da rojo, antes de cambiar lo que haces, revisa contra qué te está comparando. La vara rota es mucho más común que el trabajo malo.

Preguntas frecuentes

¿Qué es una inversión en este contexto?
Una predicción alta que sale baja. Mi sistema puntúa la idea de 0 a 100 antes de grabar; si le pone 80 o más y luego la pieza rinde por debajo del promedio del canal, esa predicción es una inversión. Es la forma de saber que la rúbrica no está midiendo lo que cree medir.
¿Por qué guardar la predicción antes de publicar y no después?
Porque después ya sabes el resultado y el cerebro reescribe la expectativa sin pedirte permiso. Escribir la nota con fecha, antes, es lo único que convierte una opinión en algo que puede salir mal y demostrarlo.
¿La mediana o el promedio?
La mediana, siempre que tu catálogo tenga piezas muy desiguales. En mi caso doce videos multiplicaban por cinco la audiencia del resto: el promedio quedaba arrastrado por ellos y ninguna pieza normal podía alcanzarlo. La mediana describe al centro real.
¿Cómo sé si mi baseline está contaminado?
Separa tu catálogo en los dos o tres tipos de contenido que de verdad haces y calcula la mediana de cada grupo. Si entre grupos hay más del doble de diferencia, un baseline único te está mintiendo y necesitas uno por carril.

Fuentes