FaroQuant / Cómo se prueba

Metodología

Cómo se prueba FaroQuant: anclaje, métricas y sus límites

El copiloto de IA de FaroQuant tiene instrucciones de tomar cada número de un motor cuantitativo probado, y un verificador busca los números que no salieron de ahí. Esta página dice exactamente qué hace esa revisión, qué no puede hacer, qué hemos medido y qué deja fuera cada métrica.

Respuesta corta

Aquí “anclaje” significa una sola cosa: cada número de una respuesta debe poder rastrearse hasta un resultado de herramienta de la misma pregunta. El verificador marca los que no, y la app muestra la marca. Sin historial de chat, las respuestas del modelo local de prueba salieron limpias 59 de 60 veces. Con historial, que es como funciona el chat real, muchas veces respondió de memoria: 24 de 60 respuestas salieron limpias y se marcaron 243 números. Un número que pasa es rastreable, que no es lo mismo que estar bien explicado.

Qué hace el verificador

El copiloto tiene instrucciones de responder llamando cinco herramientas que usan el motor cuantitativo de FaroQuant: un resumen del portafolio, una métrica, el detalle de una posición, un escenario de caída de precio y una comparación con el índice de referencia. Después de que responde, el verificador:

  1. saca todos los números de la respuesta;
  2. junta todos los números de los resultados de herramientas de ese turno;
  3. acepta un número de la respuesta si coincide con uno de las herramientas tal cual, con el signo cambiado, o multiplicado o dividido entre 100 (así −0.1795 puede aparecer como 17.95%), con una tolerancia de 1% o 0.005;
  4. marca todo lo demás y le muestra las marcas al usuario.

Esto sigue la definición que usan los principales proveedores: anclar es ligar la respuesta a fuentes verificables, y eso reduce el contenido inventado en vez de eliminarlo.[1][2] El NIST llama confabulación al contenido inventado y lo nombra como un riesgo de la IA generativa.[3]

Qué no puede detectar

Qué hemos medido

La evaluación hace 20 preguntas fijas, 14 en inglés y 6 en español, incluidas dos de “¿compro o vendo?” que deben rechazarse, sobre un portafolio de demostración. Corre en dos modos: independiente, donde cada pregunta va sola, y con historial, que es como el chat real envía las preguntas. El 24 de septiembre de 2026 corrimos cada modo tres veces con el modelo local qwen2.5:7b, a la temperatura por defecto del código, 0.2.

CorridaIndependiente: respuestas limpiasIndependiente: números marcadosCon historial: respuestas limpiasCon historial: números marcados
120 / 2007 / 2059
219 / 2018 / 2087
320 / 2009 / 2097
Total59 / 60124 / 60243

Registros crudos: docs/eval-logs en el repositorio (los archivos que empiezan con run7-2026-09-24).

Con historial, 33 de las 60 respuestas no usaron ninguna herramienta, y 32 de esas se marcaron. El historial del chat guarda las respuestas anteriores pero no sus resultados de herramientas, así que un número repetido sin una nueva llamada solo pudo salir de una respuesta anterior. De los 243 números marcados, el 26% coincidía con una respuesta anterior que había pasado la revisión, el 27% solo con una respuesta anterior marcada, y el 47% no aparecía en ninguna parte de la conversación que el modelo podía ver.

Una corrida de julio de 2026 de la misma evaluación dio 3 de 20 limpias con historial. No leemos los números de hoy como una mejora: las instrucciones en inglés y español no han cambiado desde entonces, y tres corridas de 20 preguntas son una muestra pequeña.

Qué no se ha medido

Las métricas, y lo que cada una no te dice

Cada métrica de abajo la calcula el motor de FaroQuant a partir de unos dos años de precios de cierre diarios, contra SPY como índice de referencia y con una tasa libre de riesgo fija de 4.3%. Las pruebas unitarias comparan la aritmética con bibliotecas independientes. No demuestran que ninguna métrica prediga nada.

Razón de Sharpe

Cómo se calculaEl rendimiento diario promedio por encima de la tasa libre de riesgo, dividido entre su desviación estándar, y multiplicado por √252 para anualizarlo.

Lo que no te diceCómo encaja una inversión con el resto de tu portafolio, ni cuál será la razón en el futuro. El propio Sharpe advirtió contra tratar las razones históricas como pronósticos.[5] El número también es una estimación con su propio error, y el escalamiento por √252 supone que los rendimientos de un día a otro son independientes, lo que no siempre se cumple.[6] FaroQuant no reporta un intervalo de confianza.

Razón de Sortino

Cómo se calculaComo Sharpe, pero solo cuenta la volatilidad por debajo de un rendimiento mínimo aceptable, aquí la tasa libre de riesgo, medida sobre todos los días y anualizada por √252.

Lo que no te diceEl riesgo total. El resultado depende del rendimiento mínimo que elijas y de qué versión de la fórmula se use, y cuando pocos días quedan por debajo del objetivo puede subestimar mucho el riesgo. El documento del CFA Institute en el que nos basamos también señala, citando a Sortino y Forsey, que anualizar así una desviación a la baja construida con rendimientos históricos es incorrecto.[7]

Beta y alfa de Jensen

Cómo se calculaLa beta es la covarianza de los rendimientos del portafolio con los de SPY, dividida entre la varianza de SPY. La alfa es el rendimiento anualizado que queda después de tomar en cuenta esa beta.

Lo que no te diceUn número estable y preciso. La beta mide solo el riesgo de mercado, frente al índice que elegiste, y las estimaciones cambian con la ventana de tiempo, el índice y si los rendimientos son diarios, semanales o mensuales; errores estándar de 0.5 o más son comunes.[8] FaroQuant no reporta un error estándar.

Valor en Riesgo (VaR)

Cómo se calculaEl VaR histórico es la pérdida en el percentil 5 (o 1) de los rendimientos diarios pasados. El VaR paramétrico supone que los rendimientos tienen una distribución normal. Como los datos son rendimientos diarios, los dos son cifras de un día.

Lo que no te diceEl peor caso. El VaR es una estimación de la pérdida potencial a cierto nivel de confianza.[9] En el VaR histórico al 95%, por construcción, cerca de 1 de cada 20 días de la muestra perdió más que la cifra de VaR. Por eso “la pérdida en el peor escenario” es la forma equivocada de describirlo.

CVaR (pérdida esperada en la cola)

Cómo se calculaEl promedio de las pérdidas más allá del VaR histórico al 95%.

Lo que no te diceCómo será el próximo mal día. Describe la cola de una muestra pasada. Los reguladores bancarios pasaron del VaR a la pérdida esperada (expected shortfall) porque capta mejor el riesgo de cola, lo que dice algo sobre el punto ciego del VaR, no sobre la precisión del CVaR.[10]

Caída máxima (drawdown)

Cómo se calculaLa mayor caída desde un máximo del valor del portafolio hasta un mínimo posterior, en la ventana de dos años.

Lo que no te diceUna cifra que puedas comparar entre ventanas distintas. Mientras más largo el periodo medido, mayor la caída máxima que cabe esperar,[11] y los datos diarios pueden mostrar mínimos más profundos que los de fin de mes. Tampoco dice cuánto tardó la recuperación; los reguladores que la definen para fondos de materias primas piden las fechas por separado.[12]

De dónde vienen los datos

Los precios de cierre diarios llegan a través de yfinance, una biblioteca de código abierto que no está afiliada ni avalada por Yahoo; su documentación dice que está pensada para investigación y educación y remite a los términos de Yahoo, que restringen la recolección automatizada de datos.[13][14] Así que los datos no son oficiales, ni con licencia, ni en tiempo real. Los precios se guardan en caché 24 horas, un caché vencido se marca como vencido, y si se usa un proveedor de respaldo, sus precios vienen ajustados por divisiones de acciones pero no por dividendos.

Lo que FaroQuant no hace

No hay modelos de valuación ni de flujo de caja descontado, ni precios objetivo, ni pronósticos, ni ejecución de operaciones, ni conexión con tu casa de bolsa, ni asesoría personalizada. El copiloto tiene instrucciones de rechazar preguntas de “¿compro?” y explicar las métricas relevantes; es una instrucción, no una garantía, y por eso la evaluación la pone a prueba. FaroQuant es una herramienta educativa, no un asesor de inversiones registrado.

Fuentes

  1. Google Cloud, “Grounding overview”, documentación de Vertex AI. docs.cloud.google.com
  2. Anthropic, “Reduce hallucinations”, documentación de Claude. platform.claude.com
  3. NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1), julio de 2024. doi.org/10.6028/NIST.AI.600-1
  4. Anthropic, “Tool use with Claude”, documentación de Claude. platform.claude.com
  5. William F. Sharpe, “The Sharpe Ratio”, Journal of Portfolio Management 21(1), 1994. Copia del autor
  6. Andrew W. Lo, “The Statistics of Sharpe Ratios”, Financial Analysts Journal 58(4), 2002. doi.org/10.2469/faj.v58.n4.2453
  7. Deborah Kidd, “The Sortino Ratio: Is Downside Risk the Only Risk that Matters?”, CFA Institute, 2012. PDF
  8. Aswath Damodaran, “Estimating Risk Parameters”, documento de trabajo, NYU Stern. PDF
  9. Regla 18f-4 de la SEC, 17 CFR 270.18f-4(a), definición de valor en riesgo. eCFR
  10. Comité de Supervisión Bancaria de Basilea, “Minimum capital requirements for market risk”, enero de 2019. bis.org
  11. Malik Magdon-Ismail, Amir F. Atiya, Amrit Pratap y Yaser S. Abu-Mostafa, “On the Maximum Drawdown of a Brownian Motion”, Journal of Applied Probability 41(1), 2004. doi.org/10.1239/jap/1077134674
  12. Regla de la CFTC, 17 CFR 4.10(k)–(l), definiciones de drawdown y de la peor caída de máximo a mínimo. eCFR
  13. README de yfinance, GitHub. github.com/ranaroussi/yfinance
  14. Términos de servicio de Yahoo. legal.yahoo.com

Escrito por , quien construyó FaroQuant. Los resultados de esta página tienen la fecha de las corridas que los produjeron. Nada de lo que hay aquí es asesoría de inversión.