@@ -398,14 +398,15 @@ def get_embedder():
398398 return model
399399
400400
401- def embed_texts (model , texts : list [str ]) -> np .ndarray :
401+ def embed_texts (model , texts : list [str ], desc : str = " embedding" ) -> np .ndarray :
402402 """Return L2-normalised float32 embeddings, shape (N, D)."""
403403 vecs = model .encode (
404404 texts ,
405405 batch_size = BATCH_SIZE ,
406- show_progress_bar = False ,
406+ show_progress_bar = True ,
407407 normalize_embeddings = True , # cosine sim → inner product on unit sphere
408408 convert_to_numpy = True ,
409+ tqdm_kwargs = {"desc" : desc , "unit" : "text" , "leave" : False },
409410 )
410411 return vecs .astype (np .float32 )
411412
@@ -663,15 +664,15 @@ def align(caption_path: Path, slide_path: Path,
663664
664665 slide_texts = _enrich_sparse_slides ([s .text if s .text .strip () else s .label for s in slides ])
665666 print (f" Embedding { len (slides )} slides..." )
666- slide_embs = embed_texts (embedder , slide_texts )
667+ slide_embs = embed_texts (embedder , slide_texts , desc = " slides" )
667668 index = build_faiss_index (slide_embs )
668669
669670 # ── Embed transcript segments (with context window) ───────────────────────
670671 print (f" Building context windows (±{ CONTEXT_SEC :.0f} s)..." )
671672 window_texts = build_window_texts (segments , CONTEXT_SEC )
672673
673674 print (f" Embedding { len (window_texts )} transcript windows..." )
674- seg_embs = embed_texts (embedder , window_texts ) # (T, D)
675+ seg_embs = embed_texts (embedder , window_texts , desc = " transcript" ) # (T, D)
675676
676677 # ── Raw similarity scores: each segment vs all slides ─────────────────────
677678 # faiss.search returns (scores, indices); with IndexFlatIP + normalised
@@ -849,7 +850,7 @@ def align_multi_slides(
849850 print (f" Building context windows (±{ CONTEXT_SEC :.0f} s)..." )
850851 window_texts = build_window_texts (segments , CONTEXT_SEC )
851852 print (f" Embedding { len (window_texts )} transcript windows..." )
852- seg_embs = embed_texts (embedder , window_texts )
853+ seg_embs = embed_texts (embedder , window_texts , desc = " transcript" )
853854
854855 # ── FAISS search → log-likelihood matrix ──────────────────────────────────
855856 print (" Querying FAISS index..." )
0 commit comments