Pure deterministic AI agent trajectory evaluation engine — zero judge-LLM cost, zero non-determinism, zero API latency.
-
Updated
Jul 29, 2026 - Python
Pure deterministic AI agent trajectory evaluation engine — zero judge-LLM cost, zero non-determinism, zero API latency.
Multi-pass agent that grades plans/PRDs on priority-definition quality. Line-cited evidence, deterministic citation verifier, 9887/10000 on a hand-rated calibration set.
A lightweight, from-scratch implementation of standard Retrieval-Augmented Generation (RAG) evaluation metrics. It computes Faithfulness, Answer Relevance, Context Recall, and Context Precision without relying on heavy external evaluation frameworks
Pipeline to investigate structured reasoning and instruction adherence in multimodal LLMs
To associate your repository with the deterministic-eval topic, visit your repo's landing page and select "manage topics."