You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Síntoma: no existe ninguna evidencia de que el modelo elegido sea capaz de imitar una voz autoral. La puerta de riesgo R1 del MVP se dio por superada sin datos.
Evidencia de la ausencia:bob/sessions/week1/baseline_eval.md no existe. Búsquedas realizadas: find . -iname "*baseline*" (solo un acierto dentro de .venv, ajeno); grep insensible de baseline|voice-match|5 prompts|llama-3-1-405b|6/10 sobre bob/**/*.md (dos aciertos metodológicos, bob/playbook.md:146 y bob/custom-modes/generation-conductor.md:95, ningún resultado); git log --all --diff-filter=A --name-only --pretty=format: | grep -i "baseline\|week1\|week2" → cero (el fichero nunca existió en ninguna rama); gh pr list --state merged → ningún PR referido a [bob] Validate Llama-3.3-70b voice-matching quality, 5 prompts #11. Los 26 exports de bob/sessions/ no contienen puntuaciones de calidad de voz.
Causa raíz: la tarea se cerró sin ejecutarse. No hay causa técnica.
Ficheros a tocar:bob/sessions/Sprint_1/baseline_eval.md (nuevo — usar la convención de carpetas real del repo, Sprint_1/, no el week1/ del texto de la issue, que ya no se usa). Si el resultado dispara la escalada, además una entrada en docs/decision_log.md.
Definición de hecho:
El documento existe y contiene: los 5 prompts fijos (textuales), el autor objetivo de cada uno, la salida sin condicionar de meta-llama/llama-3-3-70b-instruct, una puntuación 1-10 de parecido de voz por prompt con quién la puso, y la media.
El veredicto de la puerta está escrito explícitamente: media ≥ 6/10 → seguir con Llama 3.3 70B; media < 6/10 → escalar según docs/MVP.md:512 (R1: condicionamiento más fuerte / más pasajes RAG, llama-3-1-405b, granite-3-8b, y como último recurso Mistral Large vía Watsonx), y en ese caso una fila nueva en docs/decision_log.md.
Las salidas son reproducibles: el documento anota model_id, temperature, max_tokens y fecha.
Contexto obligatorio para el ejecutor:docs/MVP.md §2 (los model IDs LOCKED y el porqué de usar el mismo modelo en ambos lados), docs/MVP.md:329 (el enunciado de la SPRINT 1 TASK: "validate voice-matching quality with 5 real prompts … if Llama < 6/10 human eval, escalate"), docs/MVP.md:512 (la fila R1 con el plan B exacto), docs/MVP.md:78-80 (el prompt de la demo, buen candidato a ser uno de los cinco) y bob/playbook.md (formato de export de sesiones que el equipo ya usa).
Bloqueada por:WO-10. Sin acceso funcional a Watsonx no se puede generar nada que evaluar.
Conflicto de ficheros: ninguno.
Tamaño: S.
Riesgo de regresión: ninguno sobre el código. Riesgo de proyecto real: si la media sale < 6/10, se abre una escalada de modelo a estas alturas del calendario. Ese resultado hay que reportarlo, no maquillarlo — es exactamente para lo que existía la puerta.
Contrato del ejecutor
Implementa esta orden y nada más. El alcance es la ficha de arriba.
Antes de tocar código, lee enteros los ficheros de Contexto obligatorio. Son los documentos rectores del repo: si tu implementación contradice a uno, manda el documento, no el texto de esta issue.
Prohibido:
Tocar ficheros fuera de Ficheros a tocar.
Debilitar, saltar (skip/xfail) o borrar un test para poner algo en verde.
Relajar una constante, un umbral o un criterio para que la Definición de hecho se cumpla.
Ampliar el alcance a mejoras que veas de paso (anótalas en un comentario, no las hagas).
Al terminar: ejecuta tú mismo los comandos de Definición de hecho y pega su salida literal en un comentario. Si alguno no pasa, dilo — no lo maquilles. Un verificador independiente los repetirá en frío.
Si el arreglo destapa un problema nuevo (ver Riesgo de regresión): repórtalo y para. No lo resuelvas por tu cuenta.
Rama: fix/wo-NN-<slug>. No toques main directamente.
Orden de trabajo generada desde docs/completeness_audit.md (auditoría de las 29 issues cerradas, 2026-07-27). El texto de la ficha es literal del informe.
bobbob/sessions/week1/baseline_eval.mdno existe. Búsquedas realizadas:find . -iname "*baseline*"(solo un acierto dentro de.venv, ajeno); grep insensible debaseline|voice-match|5 prompts|llama-3-1-405b|6/10sobrebob/**/*.md(dos aciertos metodológicos,bob/playbook.md:146ybob/custom-modes/generation-conductor.md:95, ningún resultado);git log --all --diff-filter=A --name-only --pretty=format: | grep -i "baseline\|week1\|week2"→ cero (el fichero nunca existió en ninguna rama);gh pr list --state merged→ ningún PR referido a [bob] Validate Llama-3.3-70b voice-matching quality, 5 prompts #11. Los 26 exports debob/sessions/no contienen puntuaciones de calidad de voz.bob/sessions/Sprint_1/baseline_eval.md(nuevo — usar la convención de carpetas real del repo,Sprint_1/, no elweek1/del texto de la issue, que ya no se usa). Si el resultado dispara la escalada, además una entrada endocs/decision_log.md.meta-llama/llama-3-3-70b-instruct, una puntuación 1-10 de parecido de voz por prompt con quién la puso, y la media.docs/MVP.md:512(R1: condicionamiento más fuerte / más pasajes RAG,llama-3-1-405b,granite-3-8b, y como último recurso Mistral Large vía Watsonx), y en ese caso una fila nueva endocs/decision_log.md.model_id,temperature,max_tokensy fecha.test -f bob/sessions/Sprint_1/baseline_eval.md && grep -c "^## Prompt" bob/sessions/Sprint_1/baseline_eval.mddevuelve5.docs/MVP.md§2 (los model IDs LOCKED y el porqué de usar el mismo modelo en ambos lados),docs/MVP.md:329(el enunciado de la SPRINT 1 TASK: "validate voice-matching quality with 5 real prompts … if Llama < 6/10 human eval, escalate"),docs/MVP.md:512(la fila R1 con el plan B exacto),docs/MVP.md:78-80(el prompt de la demo, buen candidato a ser uno de los cinco) ybob/playbook.md(formato de export de sesiones que el equipo ya usa).Contrato del ejecutor
Implementa esta orden y nada más. El alcance es la ficha de arriba.
Antes de tocar código, lee enteros los ficheros de Contexto obligatorio. Son los documentos rectores del repo: si tu implementación contradice a uno, manda el documento, no el texto de esta issue.
Prohibido:
skip/xfail) o borrar un test para poner algo en verde.Al terminar: ejecuta tú mismo los comandos de Definición de hecho y pega su salida literal en un comentario. Si alguno no pasa, dilo — no lo maquilles. Un verificador independiente los repetirá en frío.
Si el arreglo destapa un problema nuevo (ver Riesgo de regresión): repórtalo y para. No lo resuelvas por tu cuenta.
Rama:
fix/wo-NN-<slug>. No toquesmaindirectamente.Orden de trabajo generada desde
docs/completeness_audit.md(auditoría de las 29 issues cerradas, 2026-07-27). El texto de la ficha es literal del informe.