Skip to content

Add LongMemEval benchmark harness - #70

Open
Atharva-Kanherkar wants to merge 1 commit into
masterfrom
longmemeval-harness
Open

Atharva-Kanherkar wants to merge 1 commit into
masterfrom
longmemeval-harness

Conversation

@Atharva-Kanherkar

Copy link
Copy Markdown
Collaborator

harness
This pull request introduces a new LongMemEval benchmark harness for evaluating long-term conversational memory, adds corresponding tests, and improves configuration flexibility for embedding models and dimensions. It also updates development dependencies to support benchmarking.

LongMemEval benchmark harness:

  • Added a LongMemEval harness for benchmarking long-term conversational memory, with usage instructions and dataset handling described in the README.md.
  • Added tests/test_longmemeval_harness.py with tests for session ordering, evidence marking, and exact match normalization in the harness.

Configuration improvements:

  • Updated config.py to allow EMBEDDING_MODEL and EMBEDDING_DIMENSIONS to be set via environment variables for easier configuration and experimentation.

Development dependencies:

  • Added a bench extra in pyproject.toml to install OpenAI for benchmarking purposes.

@vercel

vercel Bot commented Mar 31, 2026

Copy link
Copy Markdown

The latest updates on your projects. Learn more about Vercel for GitHub.

Project Deployment Actions Updated (UTC)
agentic-memory Ready Ready Preview, Comment Mar 31, 2026 6:28am

This branch was successfully deployed

1 active deployment
Preview — a11e36aa Deployed Mar 31, 2026 by vercel[bot]
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant