Motor de Precio Dinámico · Deep RLAprendizaje por refuerzo en mejora continua

🏠 Inicio

El motor, en vivo

El agente entrena en un loop contra el mercado (Q-learning y PPO), compara ambas políticas y usa la mejor. Cada oferta real aceptada o rechazada lo hace aprender de nuevo. Siempre respeta el piso del contrato.

Ingreso esperado por nivel de precio

Precio × probabilidad de venta. La barra dorada es el óptimo aprendido: el precio más justo que también cierra ventas.

Curva de aprendizaje (convergencia)

Recompensa promedio por episodio: el agente mejora hasta estabilizarse en la política óptima.

Log de mejora continua — en tiempo real

Cada entrenamiento, comparación de políticas y aprendizaje desde ofertas reales queda registrado aquí (se actualiza cada 15 s).
Esperando eventos…

¿Por qué es una innovación revolucionaria para fijar el precio más justo?

🎯 Aprende el precio justo, no lo adivina

Los métodos tradicionales usan promedios históricos o la palabra del intermediario. Este motor aprende por prueba y error la política que maximiza precio × probabilidad de venta: el punto donde el productor gana más sin espantar al comprador. Ese equilibrio ES el precio justo del mercado.

🛡️ El piso del contrato es sagrado

Por construcción, el agente jamás sugiere un precio bajo el piso contractual del productor. La banda del contrato es una restricción del modelo, no una sugerencia: protege al agricultor de la presión a la baja.

🔁 Mejora continua con cada transacción

Cada oferta real aceptada o rechazada re-entrena al agente (aprendizaje online). El precio deja de ser una foto estática y se vuelve un organismo que se adapta a la estacionalidad y a la demanda real del Valle de Azapa.

⚖️ Dos cerebros compitiendo, gana el mejor

El modo AUTO entrena dos algoritmos distintos (Q-learning y PPO), compara el ingreso esperado de cada política y usa la ganadora. Nadie fija el precio a dedo: compiten métodos, y la evidencia decide.

📖 Transparente y auditable

Todo lo que el motor aprende queda en un log con hora y métricas (este mismo panel). Un regulador, un productor o un comprador pueden ver POR QUÉ el precio es el que es. La opacidad de la intermediación se reemplaza por evidencia.

🚀 Diseñado para escalar a redes neuronales

La interfaz del motor es intercambiable: cuando el historial de transacciones sea suficiente, la misma API se respalda con PPO profundo (redes neuronales) sin tocar el resto del sistema. La graduación está en el plan de I+D.