Wiser Retail Strategies | Wiser Solutions

Le hemos dado un catálogo a Codex. Esto es lo que se le ha pasado por alto.

Escrito por Héloïse Tobin | 5 ago 2026

De vez en cuando, un director financiero echa un vistazo a la partida presupuestaria dedicada a la inteligencia de precios y se pregunta si el equipo no podría crearla por su cuenta. Basta con que Point Claude o Codex accedan al catálogo, recopilen datos de los mismos minoristas y se ahorren por completo la comisión del proveedor. Sobre el papel, parece un problema que la IA debería ser capaz de resolver.

Así que lo probamos con nuestros propios catálogos para averiguarlo.

Por qué una coincidencia fallida no parece una coincidencia fallida

Lo complicado de una coincidencia omitida es que no se anuncia por sí misma. No hay ningún mensaje de error ni ninguna señal de alerta en el panel de control que te indique que se ha pasado por alto la ficha de un competidor. El SKU simplemente no aparece y todas las decisiones que dependen de él se toman sin tener en cuenta esa información. Ese es el verdadero riesgo de cambiar una plataforma diseñada específicamente por un rastreo de IA «hazlo tú mismo». En lugar de que un equipo especializado detecte el error, te darás cuenta semanas más tarde, cuando el cambio de precio de un competidor en un SKU que nunca has rastreado ya haya mermado tu margen.

Prueba uno: 5.000 SKU, dos minoristas, 3,5 horas

Para la primera prueba, ejecutamos Codex con un catálogo de 5.000 SKU de dos minoristas y le asignamos la misma tarea que nuestro sistema de producción gestiona a diario: crear un feed de precios de la competencia. La tarea tardó tres horas y 23 minutos en completarse. La precisión se situó entre el 48 % y el 49 %, frente al 97 % de precisión en producción de Wiser con catálogos similares. La exhaustividad —es decir, la proporción de entradas que deberían haber coincidido y lo hicieron— se situó en torno al 25 %, frente al 90 % de Wiser. No se trata de una diferencia insignificante: más de la mitad de la actividad de la competencia en ese catálogo nunca llegó a incluirse en el informe.

Prueba dos: el catálogo de un cliente real, ejecutado en «modo objetivo»

La segunda prueba proporcionó a la IA aún menos estructura. Le entregamos a Codex el catálogo de un cliente real, con 5.361 productos, y dejamos que funcionara de forma autónoma en «modo objetivo» con una única instrucción: elaborar un informe de precios de la competencia. Tardó tres horas y veintitrés minutos. Cuando comprobamos aleatoriamente unas veinte de las coincidencias que encontró, todas y cada una de ellas eran correctas. Así pues, la IA es realmente capaz de confirmar que dos anuncios corresponden al mismo producto una vez que los encuentra.

Pero encontrarlas resultó ser la parte difícil. Codex detectó 2.660 coincidencias en Amazon y 39 en Google. El sistema de Wiser encuentra aproximadamente 4.000 en Amazon y 2.000 en Google para ese mismo catálogo, lo que significa que la IA detectó alrededor del 2 % de lo que nuestro sistema detecta solo en Google. También se topó con problemas de los que un enfoque basado en hojas de cálculo y API no te avisa de antemano, como que nos bloquearan la IP en una tienda sin haber configurado ningún proxy para sortear el bloqueo. La tarea consumió 28 millones de tokens, de los cuales 23 millones se almacenaron en caché, por lo que volver a ejecutarla con el mismo catálogo no resultaría mucho más barato.

El cálculo de costes no cuadra

Esa tarea costó 23,74 dólares ejecutarla una vez según los precios directos de la API. Si se ejecuta a diario durante un año, el coste asciende a unos 8 000 dólares, para un catálogo de poco más de cinco mil productos, con menos de un tercio de la cobertura de un sistema diseñado específicamente para ello. Y esa cifra solo cubre la factura de la API. No incluye el tiempo de ingeniería dedicado a mantener la rotación de proxies, la lógica de reintentos y los límites de tasa, todo un trabajo que Wiser ya ha resuelto a gran escala. El cálculo del «hazlo tú mismo» con IA solo parece atractivo si nadie suma lo que cuesta la cobertura que falta y el mantenimiento que conlleva.

Por qué existe esta diferencia

Parte del motivo por el que la diferencia es tan grande se debe a lo que requiere la correspondencia entre dos anuncios. No se trata de una simple búsqueda: implica la extracción de atributos, la estandarización, la categorización y una comparación entre todos los atributos para decidir si dos anuncios son lo suficientemente similares como para considerarlos el mismo producto. Wiser ejecuta en paralelo la coincidencia basada en tokens y en vectores, y deriva los casos dudosos a un modelo de lenguaje grande (LLM) para su revisión, ya que ejecutar esa lógica de forma secuencial simplemente no resultaba lo suficientemente preciso. Un agente de programación al que se le pide que «elabore un informe de precios» no cuenta con ninguna de esas infraestructuras integradas. Se le puede indicar el problema, pero no se le puede indicar la escala.

La respuesta sincera sobre «crear o comprar»

Si estás sopesando si desarrollar esto internamente, la respuesta sincera es que la IA puede replicar una parte de lo que hace un proveedor de inteligencia de precios y, en una pequeña muestra que se comprueba manualmente, puede incluso parecer precisa al hacerlo. Lo que aún no puede replicar es la cobertura a gran escala, la resiliencia frente a los obstáculos que plantea cada minorista, o una curva de costes que se mantenga plana en lugar de aumentar con la factura de tokens a medida que crece tu catálogo. La verdadera pregunta no es si la IA puede encontrar algunos precios competitivos. Es si «algunos» son suficientes para tomar una decisión sobre los márgenes y si las referencias que se le escapan son precisamente las que más te cuestan.