Hermes tool-contract hard v1: 50 cases. Primary score is tool/state pass rate. tool_state=72%, strict=72%, final_text=86%, schema_valid=100%, required_tool=92%, hallucinated_tool=0%, forbidden_tool=0%, recovery=50.0%. avg_tool_calls=3.70, avg_turns=3.66, output_tps=16.0, input_tokens=61493, output_tokens=8086. non_text_failures: final_state_wrong=4, max_tool_calls=8, missing_required_tool=4, too_many_tool_calls=12. strict_failure_breakdown: final_answer_missing_expected_text=7, final_state_wrong=4, max_tool_calls=8, missing_required_tool=4, too_many_tool_calls=12. Reference run via Hermes openai-codex OAuth adapter.
Artifact/log: -OpenAI Codex
GPT-5.6 Sol
OpenAI Codex OAuth provider. Reference agentic tool-use run through the Hermes Codex adapter.
Score Summary
Overall eligibility requires eligible data in all four categories.
Overall
Incomplete for overall leaderboards
Agentic Tool Use
2/2 benchmarks covered
Agentic Coding
0/0 benchmarks covered
Long-Term Tasks
0/0 benchmarks covered
Speed
0/0 benchmarks covered
Latest Results
2 eval runs
Hermes tool-contract v0: 100 cases. Primary score is tool/state pass rate. tool_state=93%, strict=86%, final_text=88%, schema_valid=100%, required_tool=99%, hallucinated_tool=0%, forbidden_tool=0%, recovery=42.9%. avg_tool_calls=1.40, avg_turns=2.27, output_tps=13.4, input_tokens=42571, output_tokens=7320. non_text_failures: final_state_wrong=2, max_tool_calls=4, missing_required_tool=1. strict_failure_breakdown: final_answer_missing_expected_text=12, final_state_wrong=2, max_tool_calls=4, missing_required_tool=1. Reference run via Hermes openai-codex OAuth adapter.
Artifact/log: -Historical Runs
2 eval runs
Hermes tool-contract hard v1: 50 cases. Primary score is tool/state pass rate. tool_state=72%, strict=72%, final_text=86%, schema_valid=100%, required_tool=92%, hallucinated_tool=0%, forbidden_tool=0%, recovery=50.0%. avg_tool_calls=3.70, avg_turns=3.66, output_tps=16.0, input_tokens=61493, output_tokens=8086. non_text_failures: final_state_wrong=4, max_tool_calls=8, missing_required_tool=4, too_many_tool_calls=12. strict_failure_breakdown: final_answer_missing_expected_text=7, final_state_wrong=4, max_tool_calls=8, missing_required_tool=4, too_many_tool_calls=12. Reference run via Hermes openai-codex OAuth adapter.
Artifact/log: -Hermes tool-contract v0: 100 cases. Primary score is tool/state pass rate. tool_state=93%, strict=86%, final_text=88%, schema_valid=100%, required_tool=99%, hallucinated_tool=0%, forbidden_tool=0%, recovery=42.9%. avg_tool_calls=1.40, avg_turns=2.27, output_tps=13.4, input_tokens=42571, output_tokens=7320. non_text_failures: final_state_wrong=2, max_tool_calls=4, missing_required_tool=1. strict_failure_breakdown: final_answer_missing_expected_text=12, final_state_wrong=2, max_tool_calls=4, missing_required_tool=1. Reference run via Hermes openai-codex OAuth adapter.
Artifact/log: -