Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
3 changes: 0 additions & 3 deletions AGENTS.md
Original file line number Diff line number Diff line change
Expand Up @@ -3,6 +3,3 @@
## Maintainability

Follow the maintainability principles in [ZEN.md](ZEN.md).



10 changes: 5 additions & 5 deletions docs/ux-ergonomics-and-harness-friction-spec.md
Original file line number Diff line number Diff line change
@@ -1,8 +1,8 @@
# RFC: Evaluator UX Ergonomics & Multi-Harness Operational Polish

**Status**: Implemented (2026-09-01)
**Date**: 2026-08-31
**Author**: Antigravity Agent
**Status**: Implemented (2026-09-01)
**Date**: 2026-08-31
**Author**: Antigravity Agent
**Context**: Post-Phase 2 dogfooding findings against live agent CLIs (`cursor-agent`, `muse`, `codex`)

Implemented against the 2026-09-01 harness-agnostic runner. Deviations from the
Expand Down Expand Up @@ -82,7 +82,7 @@ def discover_executable(executable_name: str) -> str:
found = shutil.which(executable_name)
if found:
return found

# 2. Known standard user/system bin directories
candidates = [
Path.home() / ".local" / "bin",
Expand All @@ -99,7 +99,7 @@ def discover_executable(executable_name: str) -> str:
target = directory / executable_name
if target.is_file() and os.access(target, os.X_OK):
return str(target)

raise ValueError(
f"executable {executable_name!r} not found in PATH or standard binary locations (~/.local/bin, /opt/homebrew/bin, etc.). "
f"Please supply --harness-bin /path/to/{executable_name}"
Expand Down
1 change: 0 additions & 1 deletion tests/helpers.py
Original file line number Diff line number Diff line change
Expand Up @@ -180,4 +180,3 @@ def run_calibrate(
env=self.isolated_env(root, extra_env),
)
return result, output

1 change: 0 additions & 1 deletion tests/test_calibration.py
Original file line number Diff line number Diff line change
Expand Up @@ -459,4 +459,3 @@ def test_react_v2_tasks_require_react_review_calibration_dimensions(self) -> Non
)
self.assertEqual(result.returncode, 2, result.stderr)
self.assertIn("primary_diagnosis", result.stderr)

3 changes: 1 addition & 2 deletions tests/test_harnesses.py
Original file line number Diff line number Diff line change
Expand Up @@ -697,7 +697,7 @@ def test_script_harness_live_execution(self) -> None:
skill = self.make_skill(root)
tasks = root / "tasks.jsonl"
tasks.write_text(json.dumps({"id": "t1", "prompt": "say hello", "graders": [{"type": "response_not_empty"}]}) + "\n", encoding="utf-8")

runner_script = root / "custom_runner.py"
runner_script.write_text(
'#!/usr/bin/env python3\n'
Expand Down Expand Up @@ -1008,4 +1008,3 @@ def test_long_invocation_emits_stderr_heartbeats(self) -> None:
self.assertIn(result.returncode, {0, 1}, result.stderr)
self.assertIn("still running... (elapsed:", result.stderr)
self.assertRegex(result.stderr, r"elapsed: 1[5-9]s")

3 changes: 1 addition & 2 deletions tests/test_judging.py
Original file line number Diff line number Diff line change
Expand Up @@ -299,7 +299,7 @@ def test_extract_json_payload_handles_markdown_fences(self) -> None:
self.assertEqual(evaluator.extract_json_payload(raw_json), raw_json)
self.assertEqual(evaluator.extract_json_payload(fenced_json), raw_json)
self.assertEqual(evaluator.extract_json_payload(fenced_plain), raw_json)

parsed = evaluator.load_judge_json(fenced_json)
self.assertEqual(parsed["dimensions"][0]["name"], "safe choice")

Expand Down Expand Up @@ -409,4 +409,3 @@ def test_cross_harness_judge_produces_independent_quality_evidence(self) -> None
pairwise = pair_report["pairwise"][0]
self.assertEqual(pairwise["status"], "independent")
self.assertEqual(pairwise["reason"], "cross_provider_independent_judge")

1 change: 0 additions & 1 deletion tests/test_review.py
Original file line number Diff line number Diff line change
Expand Up @@ -212,4 +212,3 @@ def test_finalize_review_rejects_incomplete_or_non_independent_labels(self) -> N
tampered = self.run_cli(*arguments)
self.assertEqual(tampered.returncode, 1)
self.assertIn("prompt hash does not match the manifest", tampered.stderr)

1 change: 0 additions & 1 deletion tests/test_tasks.py
Original file line number Diff line number Diff line change
Expand Up @@ -561,4 +561,3 @@ def test_react_v2_quality_suite_dry_run_without_calibration(self) -> None:
for dimension in grader["dimensions"]
}
self.assertEqual(names, {"primary_diagnosis", "actionable_fix", "grounded_claims"})