Skip to content

[bob] WO-14 — Ejecutar y registrar la evaluación de baseline de voice-matching de Llama-3.3-70B #95

Description

@sergi-torres

WO-14 · orden de trabajo de la auditoría de completitud.

  • Origen: issue [bob] Validate Llama-3.3-70b voice-matching quality, 5 prompts #11 · veredicto ❌ · módulo bob
  • Síntoma: no existe ninguna evidencia de que el modelo elegido sea capaz de imitar una voz autoral. La puerta de riesgo R1 del MVP se dio por superada sin datos.
  • Evidencia de la ausencia: bob/sessions/week1/baseline_eval.md no existe. Búsquedas realizadas: find . -iname "*baseline*" (solo un acierto dentro de .venv, ajeno); grep insensible de baseline|voice-match|5 prompts|llama-3-1-405b|6/10 sobre bob/**/*.md (dos aciertos metodológicos, bob/playbook.md:146 y bob/custom-modes/generation-conductor.md:95, ningún resultado); git log --all --diff-filter=A --name-only --pretty=format: | grep -i "baseline\|week1\|week2"cero (el fichero nunca existió en ninguna rama); gh pr list --state merged → ningún PR referido a [bob] Validate Llama-3.3-70b voice-matching quality, 5 prompts #11. Los 26 exports de bob/sessions/ no contienen puntuaciones de calidad de voz.
  • Causa raíz: la tarea se cerró sin ejecutarse. No hay causa técnica.
  • Ficheros a tocar: bob/sessions/Sprint_1/baseline_eval.md (nuevo — usar la convención de carpetas real del repo, Sprint_1/, no el week1/ del texto de la issue, que ya no se usa). Si el resultado dispara la escalada, además una entrada en docs/decision_log.md.
  • Definición de hecho:
    • El documento existe y contiene: los 5 prompts fijos (textuales), el autor objetivo de cada uno, la salida sin condicionar de meta-llama/llama-3-3-70b-instruct, una puntuación 1-10 de parecido de voz por prompt con quién la puso, y la media.
    • El veredicto de la puerta está escrito explícitamente: media ≥ 6/10 → seguir con Llama 3.3 70B; media < 6/10 → escalar según docs/MVP.md:512 (R1: condicionamiento más fuerte / más pasajes RAG, llama-3-1-405b, granite-3-8b, y como último recurso Mistral Large vía Watsonx), y en ese caso una fila nueva en docs/decision_log.md.
    • Las salidas son reproducibles: el documento anota model_id, temperature, max_tokens y fecha.
    • Comprobación: test -f bob/sessions/Sprint_1/baseline_eval.md && grep -c "^## Prompt" bob/sessions/Sprint_1/baseline_eval.md devuelve 5.
  • Contexto obligatorio para el ejecutor: docs/MVP.md §2 (los model IDs LOCKED y el porqué de usar el mismo modelo en ambos lados), docs/MVP.md:329 (el enunciado de la SPRINT 1 TASK: "validate voice-matching quality with 5 real prompts … if Llama < 6/10 human eval, escalate"), docs/MVP.md:512 (la fila R1 con el plan B exacto), docs/MVP.md:78-80 (el prompt de la demo, buen candidato a ser uno de los cinco) y bob/playbook.md (formato de export de sesiones que el equipo ya usa).
  • Bloqueada por: WO-10. Sin acceso funcional a Watsonx no se puede generar nada que evaluar.
  • Conflicto de ficheros: ninguno.
  • Tamaño: S.
  • Riesgo de regresión: ninguno sobre el código. Riesgo de proyecto real: si la media sale < 6/10, se abre una escalada de modelo a estas alturas del calendario. Ese resultado hay que reportarlo, no maquillarlo — es exactamente para lo que existía la puerta.

Contrato del ejecutor

Implementa esta orden y nada más. El alcance es la ficha de arriba.

Antes de tocar código, lee enteros los ficheros de Contexto obligatorio. Son los documentos rectores del repo: si tu implementación contradice a uno, manda el documento, no el texto de esta issue.

Prohibido:

  • Tocar ficheros fuera de Ficheros a tocar.
  • Debilitar, saltar (skip/xfail) o borrar un test para poner algo en verde.
  • Relajar una constante, un umbral o un criterio para que la Definición de hecho se cumpla.
  • Ampliar el alcance a mejoras que veas de paso (anótalas en un comentario, no las hagas).

Al terminar: ejecuta tú mismo los comandos de Definición de hecho y pega su salida literal en un comentario. Si alguno no pasa, dilo — no lo maquilles. Un verificador independiente los repetirá en frío.

Si el arreglo destapa un problema nuevo (ver Riesgo de regresión): repórtalo y para. No lo resuelvas por tu cuenta.

Rama: fix/wo-NN-<slug>. No toques main directamente.


Orden de trabajo generada desde docs/completeness_audit.md (auditoría de las 29 issues cerradas, 2026-07-27). El texto de la ficha es literal del informe.

Metadata

Metadata

Assignees

No one assigned

    Labels

    audit-fixArreglo derivado de la auditoria de completitud (docs/completeness_audit.md)bobready-for-humanRequires human implementationsize:S

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions