{"xai/grok-4.20-0309-non-reasoning":{"id":"xai/grok-4.20-0309-non-reasoning","name":"Grok 4.20 (Non-Reasoning)","description":"Grok model for agentic tool use, reasoning, coding, and live assistance","family":"grok","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-03-09","last_updated":"2026-03-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":30000}},"xai/grok-4.3":{"id":"xai/grok-4.3","name":"Grok 4.3","description":"xAI's default Grok for chat, coding, agentic tools, and lower hallucination risk","family":"grok","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-17","last_updated":"2026-04-17","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":30000},"benchmarks":[{"name":"Artificial Analysis Intelligence Index","score":53,"metric":"index score","version":"4.0","source":"https://artificialanalysis.ai/articles/xai-launches-grok-4-3-with-improved-agentic-performance-and-lower-pricing","date":"2026-04-30"},{"name":"GDPval-AA","score":1500,"metric":"Elo","source":"https://artificialanalysis.ai/articles/xai-launches-grok-4-3-with-improved-agentic-performance-and-lower-pricing","date":"2026-04-30"},{"name":"τ²-Bench Telecom","score":98,"metric":"success rate","source":"https://artificialanalysis.ai/articles/xai-launches-grok-4-3-with-improved-agentic-performance-and-lower-pricing","date":"2026-04-30"},{"name":"IFBench","score":81,"metric":"accuracy","source":"https://artificialanalysis.ai/articles/xai-launches-grok-4-3-with-improved-agentic-performance-and-lower-pricing","date":"2026-04-30"}]},"xai/grok-4.5":{"id":"xai/grok-4.5","name":"Grok 4.5","description":"xAI's latest Grok for chat, coding, agentic tools, and lower hallucination risk","family":"grok","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-07-08","last_updated":"2026-07-08","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":500000,"output":500000},"benchmarks":[{"name":"SWE-Bench Pro","score":64.7,"metric":"resolve rate","source":"https://x.ai/news/grok-4-5","date":"2026-07-08"},{"name":"SWE-Bench Multilingual","score":78,"metric":"resolve rate","source":"https://x.ai/news/grok-4-5","date":"2026-07-08"},{"name":"Terminal-Bench","score":83.3,"metric":"success rate","version":"2.1","source":"https://x.ai/news/grok-4-5","date":"2026-07-08"},{"name":"DeepSWE","score":62,"metric":"resolve rate","version":"1.0","source":"https://x.ai/news/grok-4-5","date":"2026-07-08"},{"name":"DeepSWE","score":53,"metric":"resolve rate","harness":"mini-swe-agent","version":"1.1","source":"https://x.ai/news/grok-4-5","date":"2026-07-08"}]},"xai/grok-4.20-0309-reasoning":{"id":"xai/grok-4.20-0309-reasoning","name":"Grok 4.20 (Reasoning)","description":"Reasoning Grok for document-heavy analysis and long-horizon tool use","family":"grok","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-03-09","last_updated":"2026-03-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":30000}},"xai/grok-build-0.1":{"id":"xai/grok-build-0.1","name":"Grok Build 0.1","description":"Fast Grok coding model tuned for agentic engineering and iterative edits","family":"grok-build","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-16","last_updated":"2026-04-16","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":256000,"output":256000}},"moonshotai/kimi-k2-thinking-turbo":{"id":"moonshotai/kimi-k2-thinking-turbo","name":"Kimi K2 Thinking Turbo","description":"Kimi reasoning model for long-horizon research, planning, and tool use","family":"kimi-thinking","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-08","release_date":"2025-11-06","last_updated":"2025-11-06","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2-Thinking"}]},"moonshotai/kimi-k2.7-code":{"id":"moonshotai/kimi-k2.7-code","name":"Kimi K2.7 Code","description":"Coding-focused Kimi model, stronger on long-horizon repo work with less overthinking","family":"kimi-k2","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-01","release_date":"2026-06-12","last_updated":"2026-06-12","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2.7-Code"}],"benchmarks":[{"name":"Kimi Code Bench","score":62,"harness":"Kimi Code CLI","version":"v2","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"},{"name":"Program Bench","score":53.6,"harness":"Kimi Code CLI","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"},{"name":"MLS Bench Lite","score":35.1,"harness":"Kimi Code CLI","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"},{"name":"MCP Atlas","score":76,"metric":"success rate","harness":"Kimi Code CLI","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"},{"name":"MCP Mark Verified","score":81.1,"metric":"success rate","harness":"Kimi Code CLI","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"},{"name":"Kimi Claw 24/7 Bench","score":46.9,"harness":"Kimi Code CLI","source":"https://huggingface.co/moonshotai/Kimi-K2.7-Code","date":"2026-06-12"}]},"moonshotai/kimi-k2-thinking":{"id":"moonshotai/kimi-k2-thinking","name":"Kimi K2 Thinking","description":"Thinking Kimi model for slower research passes, planning, and hard technical questions","family":"kimi-thinking","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-08","release_date":"2025-11-06","last_updated":"2025-11-06","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2-Thinking"}],"benchmarks":[{"name":"SWE-Bench Verified","score":71.3,"metric":"resolved","source":"https://huggingface.co/moonshotai/Kimi-K2-Thinking"}]},"moonshotai/kimi-k2.5":{"id":"moonshotai/kimi-k2.5","name":"Kimi K2.5","description":"Earlier Kimi frontier model for long-context agents, coding, and multimodal work","family":"kimi-k2","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-01","release_date":"2026-01","last_updated":"2026-01","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2.5"}],"benchmarks":[{"name":"SWE-Bench Verified","score":70.8,"metric":"resolved","source":"https://www.swebench.com/"},{"name":"SWE-Atlas Codebase QnA","score":13.1,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":20.95,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":25.77,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"}]},"moonshotai/kimi-k2.6":{"id":"moonshotai/kimi-k2.6","name":"Kimi K2.6","description":"Multimodal Kimi workhorse for agent loops, coding tasks, and visual context","family":"kimi-k2","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-04-21","last_updated":"2026-04-21","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2.6"}],"benchmarks":[{"name":"SWE-Bench Verified","score":80.2,"metric":"resolved","source":"https://huggingface.co/moonshotai/Kimi-K2.6"},{"name":"Artificial Analysis Coding Agent Index","score":50.5,"metric":"average pass@1","harness":"Claude Code","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":59.8,"metric":"pass@1","harness":"Claude Code","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":27.3,"metric":"pass@1","harness":"Claude Code","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":64.3,"metric":"pass@1","harness":"Claude Code","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"}]},"moonshotai/kimi-k2.7-code-highspeed":{"id":"moonshotai/kimi-k2.7-code-highspeed","name":"Kimi K2.7 Code Highspeed","description":"Lower-latency Kimi Code variant for interactive edits and coding-agent loops","family":"kimi-k2","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-01","release_date":"2026-06-12","last_updated":"2026-06-12","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/moonshotai/Kimi-K2.7-Code"}]},"zhipuai/glm-4.7":{"id":"zhipuai/glm-4.7","name":"GLM-4.7","description":"Mature GLM model for dependable coding, reasoning, and structured agent tasks","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-12-22","last_updated":"2025-12-22","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.7"}],"benchmarks":[{"name":"SWE-Bench Verified","score":73.8,"metric":"resolved","source":"https://huggingface.co/zai-org/GLM-4.7"},{"name":"Terminal Bench 2.0","score":33.4,"metric":"score","source":"https://huggingface.co/zai-org/GLM-4.7"}]},"zhipuai/glm-4.5v":{"id":"zhipuai/glm-4.5v","name":"GLM-4.5V","description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-08-11","last_updated":"2025-08-11","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":64000,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.5V"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":10.9,"metric":"index","source":"https://openrouter.ai/z-ai/glm-4.5v/benchmarks","date":"2026-04-29"},{"name":"SciCode","score":22.1,"metric":"percent correct","source":"https://openrouter.ai/z-ai/glm-4.5v/benchmarks","date":"2026-04-29"},{"name":"Terminal-Bench Hard","score":5.3,"metric":"success rate","source":"https://openrouter.ai/z-ai/glm-4.5v/benchmarks","date":"2026-04-29"}]},"zhipuai/glm-4.5":{"id":"zhipuai/glm-4.5","name":"GLM-4.5","description":"Hybrid-reasoning GLM release that made the 4.5 line broadly useful","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-07-28","last_updated":"2025-07-28","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":98304},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.5"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":26.3,"metric":"index","source":"https://openrouter.ai/z-ai/glm-4.5/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":34.8,"metric":"percent correct","source":"https://openrouter.ai/z-ai/glm-4.5/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":22,"metric":"success rate","source":"https://openrouter.ai/z-ai/glm-4.5/benchmarks","date":"2026-03-11"}]},"zhipuai/glm-4.7-flashx":{"id":"zhipuai/glm-4.7-flashx","name":"GLM-4.7-FlashX","description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm-flash","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-01-19","last_updated":"2026-01-19","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":200000,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.7-Flash"}]},"zhipuai/glm-5.1":{"id":"zhipuai/glm-5.1","name":"GLM-5.1","description":"Strong GLM coding model for agentic engineering, terminals, and repository generation","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-07","last_updated":"2026-04-07","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":200000,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-5.1"}],"benchmarks":[{"name":"Artificial Analysis Coding Agent Index","score":52.7,"metric":"average pass@1","harness":"Claude Code","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":73.2,"metric":"pass@1","harness":"Claude Code","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":19.8,"metric":"pass@1","harness":"Claude Code","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":65.1,"metric":"pass@1","harness":"Claude Code","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"}]},"zhipuai/glm-4.6":{"id":"zhipuai/glm-4.6","name":"GLM-4.6","description":"Late GLM-4 workhorse for coding agents, reasoning, and structured tasks","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-09-30","last_updated":"2025-09-30","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.6"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":29.5,"metric":"index","source":"https://openrouter.ai/z-ai/glm-4.6/benchmarks","date":"2026-05-22"},{"name":"SciCode","score":38.4,"metric":"percent correct","source":"https://openrouter.ai/z-ai/glm-4.6/benchmarks","date":"2026-05-22"},{"name":"Terminal-Bench Hard","score":25,"metric":"success rate","source":"https://openrouter.ai/z-ai/glm-4.6/benchmarks","date":"2026-05-22"},{"name":"SWE-Bench Pro","score":9.67,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"zhipuai/glm-5.2":{"id":"zhipuai/glm-5.2","name":"GLM-5.2","description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-06-13","last_updated":"2026-06-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-5.2"}],"benchmarks":[{"name":"SWE-Bench Pro","score":62.1,"metric":"resolve rate","source":"https://z.ai/blog/glm-5.2","date":"2026-06-16"},{"name":"Terminal-Bench","score":82.7,"metric":"success rate","harness":"Claude Code","version":"2.1","source":"https://z.ai/blog/glm-5.2","date":"2026-06-16"},{"name":"FrontierSWE","score":74.4,"metric":"dominance","source":"https://z.ai/blog/glm-5.2","date":"2026-06-16"}]},"zhipuai/glm-4.6v":{"id":"zhipuai/glm-4.6v","name":"GLM-4.6V","description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-12-08","last_updated":"2025-12-08","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.6V"}]},"zhipuai/glm-5v-turbo":{"id":"zhipuai/glm-5v-turbo","name":"GLM-5V-Turbo","description":"Fast GLM vision model for screenshots, documents, and multimodal agent tasks","family":"glm","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-04-01","last_updated":"2026-04-01","modalities":{"input":["text","image","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":131072}},"zhipuai/glm-4.5-air":{"id":"zhipuai/glm-4.5-air","name":"GLM-4.5-Air","description":"Lighter GLM-4.5 variant for fast coding assistance and cheaper agents","family":"glm-air","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-07-28","last_updated":"2025-07-28","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":98304},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.5-Air"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":23.8,"metric":"index","source":"https://openrouter.ai/z-ai/glm-4.5-air/benchmarks","date":"2026-05-30"},{"name":"SciCode","score":30.6,"metric":"percent correct","source":"https://openrouter.ai/z-ai/glm-4.5-air/benchmarks","date":"2026-05-30"},{"name":"Terminal-Bench Hard","score":20.5,"metric":"success rate","source":"https://openrouter.ai/z-ai/glm-4.5-air/benchmarks","date":"2026-05-30"}]},"zhipuai/glm-4.7-flash":{"id":"zhipuai/glm-4.7-flash","name":"GLM-4.7-Flash","description":"Budget GLM lane for fast coding help, routing, and everyday automation","family":"glm-flash","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-01-19","last_updated":"2026-01-19","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":200000,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-4.7-Flash"}],"benchmarks":[{"name":"SWE-Bench Verified","score":59.2,"metric":"resolved","source":"https://huggingface.co/zai-org/GLM-4.7-Flash"}]},"zhipuai/glm-4.5-flash":{"id":"zhipuai/glm-4.5-flash","name":"GLM-4.5-Flash","description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm-flash","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-07-28","last_updated":"2025-07-28","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":131072,"output":98304}},"zhipuai/glm-5":{"id":"zhipuai/glm-5","name":"GLM-5","description":"General GLM flagship for coding, analysis, and tool-heavy engineering workflows","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-02-12","last_updated":"2026-02-12","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/zai-org/GLM-5"}],"benchmarks":[{"name":"SWE-Bench Verified","score":72.8,"metric":"resolved","source":"https://www.swebench.com/"},{"name":"SWE-Atlas Codebase QnA","score":20.5,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":24.24,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":28.74,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"}]},"zhipuai/glm-5-turbo":{"id":"zhipuai/glm-5-turbo","name":"GLM-5-Turbo","description":"Faster GLM-5 lane for coding agents that need lower latency","family":"glm","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-03-16","last_updated":"2026-03-16","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":131072}},"mistral/codestral-latest":{"id":"mistral/codestral-latest","name":"Codestral (latest)","description":"Mistral code model for completions, refactors, and developer IDE workflows","family":"codestral","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-10","release_date":"2024-05-29","last_updated":"2025-01-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":4096},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Codestral-22B-v0.1"}],"benchmarks":[{"name":"Aider Polyglot","score":11.1,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-01-13"}]},"mistral/mistral-large-latest":{"id":"mistral/mistral-large-latest","name":"Mistral Large (latest)","description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-11","release_date":"2024-11-01","last_updated":"2025-12-02","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512"}]},"mistral/devstral-small-2507":{"id":"mistral/devstral-small-2507","name":"Devstral Small","description":"Mistral coding agent model for repository tasks and software engineering workflows","family":"devstral","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-05","release_date":"2025-07-10","last_updated":"2025-07-10","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Devstral-Small-2507"}],"benchmarks":[{"name":"SWE-Bench Verified","score":53.6,"metric":"resolved","source":"https://mistral.ai/news/devstral-2507","date":"2025-07-10"}]},"mistral/pixtral-large-latest":{"id":"mistral/pixtral-large-latest","name":"Pixtral Large (latest)","description":"Mistral's larger vision model for document-heavy image understanding and chat","family":"pixtral","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-11","release_date":"2024-11-01","last_updated":"2024-11-04","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Pixtral-Large-Instruct-2411"}]},"mistral/mistral-nemo":{"id":"mistral/mistral-nemo","name":"Mistral Nemo","description":"Efficient Mistral-NVIDIA open model for multilingual chat and local deployment","family":"mistral-nemo","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-07","release_date":"2024-07-01","last_updated":"2024-07-01","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Nemo-Instruct-2407"}]},"mistral/mistral-small-2506":{"id":"mistral/mistral-small-2506","name":"Mistral Small 3.2","description":"Efficient Mistral model for fast chat, extraction, and production assistants","family":"mistral-small","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-03","release_date":"2025-06-20","last_updated":"2025-06-20","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506"}]},"mistral/mistral-medium-latest":{"id":"mistral/mistral-medium-latest","name":"Mistral Medium (latest)","description":"Balanced Mistral model for enterprise assistants, multilingual work, and tools","family":"mistral-medium","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-29","last_updated":"2026-04-29","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Medium-3.5-128B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":77.6,"metric":"resolved","source":"https://huggingface.co/mistralai/Mistral-Medium-3.5-128B"}]},"mistral/mistral-medium-2604":{"id":"mistral/mistral-medium-2604","name":"Mistral Medium 3.5","description":"Balanced Mistral model for enterprise assistants, multilingual work, and tools","family":"mistral-medium","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-29","last_updated":"2026-04-29","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Medium-3.5-128B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":77.6,"metric":"resolved","source":"https://huggingface.co/mistralai/Mistral-Medium-3.5-128B"}]},"mistral/mistral-small-latest":{"id":"mistral/mistral-small-latest","name":"Mistral Small (latest)","description":"Efficient Mistral model for fast chat, extraction, and production assistants","family":"mistral-small","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-06","release_date":"2026-03-16","last_updated":"2026-03-16","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":256000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Small-4-119B-2603"}]},"mistral/mistral-small-2603":{"id":"mistral/mistral-small-2603","name":"Mistral Small 4","description":"Fast Mistral production model for chat, extraction, and cost-sensitive agents","family":"mistral-small","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-06","release_date":"2026-03-16","last_updated":"2026-03-16","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":256000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Small-4-119B-2603"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":24.3,"metric":"index","source":"https://openrouter.ai/mistralai/mistral-small-2603/benchmarks","date":"2026-06-01"},{"name":"SciCode","score":38,"metric":"percent correct","source":"https://openrouter.ai/mistralai/mistral-small-2603/benchmarks","date":"2026-06-01"},{"name":"Terminal-Bench Hard","score":17.4,"metric":"success rate","source":"https://openrouter.ai/mistralai/mistral-small-2603/benchmarks","date":"2026-06-01"}]},"mistral/mistral-medium-2505":{"id":"mistral/mistral-medium-2505","name":"Mistral Medium 3","description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-05","release_date":"2025-05-07","last_updated":"2025-05-07","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":131072,"output":131072},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":13.6,"metric":"index","source":"https://openrouter.ai/mistralai/mistral-medium-3/benchmarks","date":"2026-05-30"},{"name":"SciCode","score":33.1,"metric":"percent correct","source":"https://openrouter.ai/mistralai/mistral-medium-3/benchmarks","date":"2026-05-30"},{"name":"Terminal-Bench Hard","score":3.8,"metric":"success rate","source":"https://openrouter.ai/mistralai/mistral-medium-3/benchmarks","date":"2026-05-30"}]},"mistral/mistral-large-2411":{"id":"mistral/mistral-large-2411","name":"Mistral Large 2.1","description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-11","release_date":"2024-11-18","last_updated":"2024-11-18","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Large-Instruct-2411"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":13.8,"metric":"index","source":"https://openrouter.ai/mistralai/mistral-large-2407/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":29.2,"metric":"percent correct","source":"https://openrouter.ai/mistralai/mistral-large-2407/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":6.1,"metric":"success rate","source":"https://openrouter.ai/mistralai/mistral-large-2407/benchmarks","date":"2026-03-11"}]},"mistral/magistral-medium-latest":{"id":"mistral/magistral-medium-latest","name":"Magistral Medium (latest)","description":"Mistral reasoning model for transparent analysis, math, and complex decisions","family":"magistral-medium","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-06","release_date":"2025-03-17","last_updated":"2025-03-20","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384}},"mistral/devstral-medium-latest":{"id":"mistral/devstral-medium-latest","name":"Devstral 2 (latest)","description":"Mistral coding agent model for repository tasks and software engineering workflows","family":"devstral","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-12","release_date":"2025-12-02","last_updated":"2025-12-02","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Devstral-2-123B-Instruct-2512"}]},"mistral/devstral-2512":{"id":"mistral/devstral-2512","name":"Devstral 2","description":"Mistral's coding-agent model for repository work, terminal tasks, and software fixes","family":"devstral","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-12","release_date":"2025-12-09","last_updated":"2025-12-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Devstral-2-123B-Instruct-2512"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":23.7,"metric":"index","source":"https://openrouter.ai/mistralai/devstral-2512/benchmarks","date":"2026-05-31"},{"name":"SciCode","score":33.1,"metric":"percent correct","source":"https://openrouter.ai/mistralai/devstral-2512/benchmarks","date":"2026-05-31"},{"name":"Terminal-Bench Hard","score":18.9,"metric":"success rate","source":"https://openrouter.ai/mistralai/devstral-2512/benchmarks","date":"2026-05-31"}]},"mistral/pixtral-12b":{"id":"mistral/pixtral-12b","name":"Pixtral 12B","description":"Mistral vision-language model for image understanding and multimodal chat","family":"pixtral","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-09","release_date":"2024-09-01","last_updated":"2024-09-01","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Pixtral-12B-2409"}]},"mistral/mistral-large-2512":{"id":"mistral/mistral-large-2512","name":"Mistral Large 3","description":"Mistral's largest general model for enterprise agents, coding, and multilingual reasoning","family":"mistral-large","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-11","release_date":"2024-11-01","last_updated":"2025-12-02","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":22.7,"metric":"index","source":"https://openrouter.ai/mistralai/mistral-large-2512/benchmarks","date":"2026-06-04"},{"name":"SciCode","score":36.2,"metric":"percent correct","source":"https://openrouter.ai/mistralai/mistral-large-2512/benchmarks","date":"2026-06-04"},{"name":"Terminal-Bench Hard","score":15.9,"metric":"success rate","source":"https://openrouter.ai/mistralai/mistral-large-2512/benchmarks","date":"2026-06-04"}]},"mistral/devstral-medium-2507":{"id":"mistral/devstral-medium-2507","name":"Devstral Medium","description":"Mistral coding agent model for repository tasks and software engineering workflows","family":"devstral","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-05","release_date":"2025-07-10","last_updated":"2025-07-10","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":128000},"benchmarks":[{"name":"SWE-Bench Verified","score":61.6,"metric":"resolved","source":"https://mistral.ai/news/devstral-2507","date":"2025-07-10"}]},"google/gemini-2.5-pro-tts":{"id":"google/gemini-2.5-pro-tts","name":"Gemini 2.5 Pro TTS","description":"Speech generation model for controllable voice, narration, and audio delivery","family":"gemini-pro","attachment":false,"reasoning":false,"tool_call":false,"temperature":false,"knowledge":"2025-01","release_date":"2025-09-30","last_updated":"2025-12-10","modalities":{"input":["text"],"output":["audio"]},"open_weights":false,"limit":{"context":32768,"output":16384}},"google/gemini-3.1-flash-lite":{"id":"google/gemini-3.1-flash-lite","name":"Gemini 3.1 Flash Lite","description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-05-07","last_updated":"2026-05-07","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"google/gemini-3.1-flash-image":{"id":"google/gemini-3.1-flash-image","name":"Nano Banana 2","description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2025-01","release_date":"2026-05-28","last_updated":"2026-05-28","modalities":{"input":["text","image","video","pdf"],"output":["text","image"]},"open_weights":false,"limit":{"context":131072,"output":32768}},"google/gemini-2.5-pro":{"id":"google/gemini-2.5-pro","name":"Gemini 2.5 Pro","description":"Google's proven reasoning model for coding, math, and multimodal analysis","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-06-17","last_updated":"2025-06-17","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"Aider Polyglot","score":83.1,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-06-06"},{"name":"Artificial Analysis Coding Index","score":32,"metric":"index","source":"https://openrouter.ai/google/gemini-2.5-pro/benchmarks","date":"2026-06-02"},{"name":"SciCode","score":42.8,"metric":"percent correct","source":"https://openrouter.ai/google/gemini-2.5-pro/benchmarks","date":"2026-06-02"},{"name":"Terminal-Bench Hard","score":26.5,"metric":"success rate","source":"https://openrouter.ai/google/gemini-2.5-pro/benchmarks","date":"2026-06-02"}]},"google/gemini-2.5-flash-tts":{"id":"google/gemini-2.5-flash-tts","name":"Gemini 2.5 Flash TTS","description":"Speech generation model for controllable voice, narration, and audio delivery","family":"gemini-flash","attachment":false,"reasoning":false,"tool_call":false,"temperature":true,"knowledge":"2025-01","release_date":"2025-09-30","last_updated":"2025-12-10","modalities":{"input":["text"],"output":["audio"]},"open_weights":false,"limit":{"context":32768,"output":16384}},"google/gemini-2.5-flash":{"id":"google/gemini-2.5-flash","name":"Gemini 2.5 Flash","description":"Fast Gemini workhorse for multimodal apps where latency and price matter","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-06-17","last_updated":"2025-06-17","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"Aider Polyglot","score":55.1,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-25"},{"name":"Artificial Analysis Coding Index","score":22.2,"metric":"index","source":"https://openrouter.ai/google/gemini-2.5-flash/benchmarks","date":"2026-06-02"},{"name":"SciCode","score":39.4,"metric":"percent correct","source":"https://openrouter.ai/google/gemini-2.5-flash/benchmarks","date":"2026-06-02"},{"name":"Terminal-Bench Hard","score":13.6,"metric":"success rate","source":"https://openrouter.ai/google/gemini-2.5-flash/benchmarks","date":"2026-06-02"}]},"google/gemini-3.5-flash":{"id":"google/gemini-3.5-flash","name":"Gemini 3.5 Flash","description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-05-19","last_updated":"2026-05-19","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"Terminal-Bench","score":76.2,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"SWE-Bench Pro","score":55.1,"metric":"resolve rate","variant":"single attempt","dataset":"public","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"MCP Atlas","score":83.6,"metric":"success rate","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"Toolathlon","score":56.5,"metric":"success rate","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"OSWorld-Verified","score":78.4,"metric":"success rate","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"MMMU Pro","score":83.6,"metric":"accuracy","variant":"no tools","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"CharXiv Reasoning","score":84.2,"metric":"accuracy","variant":"no tools","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"Humanity's Last Exam","score":40.2,"metric":"accuracy","dataset":"full set, text + MM","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"ARC-AGI-2","score":72.1,"metric":"accuracy","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"GDPval-AA","score":1656,"metric":"Elo","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"}]},"google/gemma-4-31b-it":{"id":"google/gemma-4-31b-it","name":"Gemma 4 31B IT","description":"Largest Gemma 4 instruction model for open, self-hosted chat and reasoning","family":"gemma","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/google/gemma-4-31B-it"}]},"google/gemini-2.0-flash":{"id":"google/gemini-2.0-flash","name":"Gemini 2.0 Flash","description":"Earlier Gemini Flash workhorse for responsive multimodal apps and tool use","family":"gemini-flash","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2024-06","release_date":"2024-12-11","last_updated":"2024-12-11","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":8192}},"google/gemma-4-E4B-it":{"id":"google/gemma-4-E4B-it","name":"Gemma 4 E4B IT","description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text","image","audio"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":8192},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/google/gemma-4-E4B-it"}]},"google/gemini-embedding-001":{"id":"google/gemini-embedding-001","name":"Gemini Embedding 001","description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","family":"gemini","attachment":false,"reasoning":false,"tool_call":false,"temperature":false,"knowledge":"2025-05","release_date":"2025-05-20","last_updated":"2025-05-20","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":2048,"output":1}},"google/gemini-3.1-pro-preview-customtools":{"id":"google/gemini-3.1-pro-preview-customtools","name":"Gemini 3.1 Pro Preview Custom Tools","description":"Advanced Gemini model for complex reasoning, coding, and multimodal analysis","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-02-19","last_updated":"2026-02-19","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"google/gemini-flash-lite-latest":{"id":"google/gemini-flash-lite-latest","name":"Gemini Flash-Lite Latest","description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-09-25","last_updated":"2025-09-25","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"google/gemma-4-E2B-it":{"id":"google/gemma-4-E2B-it","name":"Gemma 4 E2B IT","description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text","image","audio"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":8192},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/google/gemma-4-E2B-it"}]},"google/gemini-3-pro-image-preview":{"id":"google/gemini-3-pro-image-preview","name":"Nano Banana Pro","description":"Nano Banana Pro for higher-fidelity image generation and design-heavy edits","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2025-01","release_date":"2025-11-20","last_updated":"2025-11-20","modalities":{"input":["text","image"],"output":["text","image"]},"open_weights":false,"limit":{"context":65536,"output":32768}},"google/gemini-2.5-flash-image":{"id":"google/gemini-2.5-flash-image","name":"Nano Banana","description":"Nano Banana image model for fast generation, edits, and character-consistent assets","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2024-06","release_date":"2025-08-26","last_updated":"2025-08-26","modalities":{"input":["text","image"],"output":["text","image"]},"open_weights":false,"limit":{"context":32768,"output":32768}},"google/gemini-2.5-flash-lite":{"id":"google/gemini-2.5-flash-lite","name":"Gemini 2.5 Flash-Lite","description":"Lean Gemini 2.5 lane for cheap multimodal traffic and quick agents","family":"gemini-flash-lite","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-06-17","last_updated":"2025-06-17","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":9.5,"metric":"index","source":"https://openrouter.ai/google/gemini-2.5-flash-lite/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":19.3,"metric":"percent correct","source":"https://openrouter.ai/google/gemini-2.5-flash-lite/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":4.5,"metric":"success rate","source":"https://openrouter.ai/google/gemini-2.5-flash-lite/benchmarks","date":"2026-03-11"}]},"google/gemini-omni-flash-preview":{"id":"google/gemini-omni-flash-preview","name":"Gemini Omni Flash Preview","description":"Video generation and editing model for fast, conversational text- and image-to-video workflows","family":"gemini","attachment":true,"reasoning":true,"tool_call":false,"release_date":"2026-06-30","last_updated":"2026-06-30","modalities":{"input":["text","image","video"],"output":["video"]},"open_weights":false,"limit":{"context":1048576,"output":57920},"benchmarks":[{"name":"LMArena Text-to-Video Arena","score":1527,"metric":"Elo","source":"https://venturebeat.com/technology/googles-gemini-omni-flash-hits-the-api-turning-enterprise-video-production-into-a-conversation","date":"2026-06-30"}]},"google/gemini-3.1-flash-image-preview":{"id":"google/gemini-3.1-flash-image-preview","name":"Nano Banana 2","description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2025-01","release_date":"2026-02-26","last_updated":"2026-02-26","modalities":{"input":["text","image","pdf"],"output":["text","image"]},"open_weights":false,"limit":{"context":65536,"output":65536}},"google/gemini-3.1-pro-preview":{"id":"google/gemini-3.1-pro-preview","name":"Gemini 3.1 Pro Preview","description":"Reasoning-first Gemini preview for agentic coding and complex problem solving","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-02-19","last_updated":"2026-02-19","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"SWE-Bench Pro","score":54.2,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"Terminal-Bench","score":70.3,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"SWE-Bench Pro","score":46.1,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"},{"name":"SWE-Atlas Codebase QnA","score":13.5,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":33.81,"metric":"score","harness":"Gemini CLI","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":29.84,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"Artificial Analysis Coding Agent Index","score":43,"metric":"average pass@1","harness":"Gemini CLI","variant":"high","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":45.6,"metric":"pass@1","harness":"Gemini CLI","variant":"high","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":15.1,"metric":"pass@1","harness":"Gemini CLI","variant":"high","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":68.3,"metric":"pass@1","harness":"Gemini CLI","variant":"high","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"GPQA Diamond","score":94.3,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":44.4,"metric":"accuracy","dataset":"full set, text + MM","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"ARC-AGI-2","score":77.1,"metric":"accuracy","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"MMMU Pro","score":80.5,"metric":"accuracy","variant":"no tools","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"MCP Atlas","score":78.2,"metric":"success rate","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"OSWorld-Verified","score":76.2,"metric":"success rate","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"CharXiv Reasoning","score":83.3,"metric":"accuracy","variant":"no tools","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"},{"name":"GDPval-AA","score":1314,"metric":"Elo","source":"https://deepmind.google/models/gemini/flash/","date":"2026-05-19"}]},"google/gemma-4-26b-a4b-it":{"id":"google/gemma-4-26b-a4b-it","name":"Gemma 4 26B A4B IT","description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/google/gemma-4-26B-A4B-it"}]},"google/gemini-3-pro-preview":{"id":"google/gemini-3-pro-preview","name":"Gemini 3 Pro Preview","description":"Preview Gemini flagship for complex reasoning, coding, and rich multimodal prompts","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-11-18","last_updated":"2025-11-18","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"SWE-Bench Pro","score":43.3,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"google/gemini-3-flash-preview":{"id":"google/gemini-3-flash-preview","name":"Gemini 3 Flash Preview","description":"New Gemini flash lane bringing frontier-style multimodal reasoning to cheaper runs","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-12-17","last_updated":"2025-12-17","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536},"benchmarks":[{"name":"SWE-Bench Pro","score":34.63,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"},{"name":"SWE-Atlas Codebase QnA","score":8.2,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":10,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":30.3,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"}]},"google/gemini-flash-latest":{"id":"google/gemini-flash-latest","name":"Gemini Flash Latest","description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2025-09-25","last_updated":"2025-09-25","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"google/gemini-3-pro-image":{"id":"google/gemini-3-pro-image","name":"Nano Banana Pro","description":"Nano Banana Pro for higher-fidelity image generation and design-heavy edits","family":"gemini-pro","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2025-01","release_date":"2026-05-28","last_updated":"2026-05-28","modalities":{"input":["text","image"],"output":["text","image"]},"open_weights":false,"limit":{"context":65536,"output":32768}},"google/gemini-3.1-flash-lite-preview":{"id":"google/gemini-3.1-flash-lite-preview","name":"Gemini 3.1 Flash Lite Preview","description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-03-03","last_updated":"2026-03-03","modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"google/gemini-2.0-flash-lite":{"id":"google/gemini-2.0-flash-lite","name":"Gemini 2.0 Flash-Lite","description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2024-06","release_date":"2024-12-11","last_updated":"2024-12-11","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":8192}},"microsoft/mai-code-1-flash":{"id":"microsoft/mai-code-1-flash","name":"MAI-Code-1-Flash","description":"Microsoft coding model built for fast, efficient assistance in everyday developer workflows","family":"mai","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-12","release_date":"2026-06-02","last_updated":"2026-06-08","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":256000,"output":128000},"links":[{"label":"Model card","url":"https://microsoft.ai/pdf/MAI-Code-1-Flash-Model-Card.PDF","type":"model_card"},{"label":"Announcement","url":"https://microsoft.ai/news/introducingmai-code-1-flash/","type":"announcement"}],"benchmarks":[{"name":"SWE-Bench Pro","score":51.2,"metric":"resolve rate","harness":"GitHub Copilot","source":"https://microsoft.ai/news/introducingmai-code-1-flash/","date":"2026-06-02"},{"name":"SWE-Bench Verified","score":71.6,"metric":"resolved","source":"https://llm-stats.com/benchmarks/swe-bench-verified"},{"name":"Terminal-Bench","score":54.8,"metric":"success rate","version":"2.0","source":"https://llm-stats.com/benchmarks/terminal-bench-2"},{"name":"GPQA Diamond","score":84.6,"metric":"accuracy","source":"https://llm-stats.com/benchmarks/gpqa"}]},"poolside/laguna-xs.2":{"id":"poolside/laguna-xs.2","name":"Laguna XS.2","description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","attachment":false,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":true,"release_date":"2026-04-28","last_updated":"2026-06-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":32768}},"poolside/laguna-m.1":{"id":"poolside/laguna-m.1","name":"Laguna M.1","description":"Poolside's flagship agentic coding model for long-horizon work","family":"laguna","attachment":false,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":true,"release_date":"2026-04-28","last_updated":"2026-06-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":32768}},"poolside/laguna-xs-2.1":{"id":"poolside/laguna-xs-2.1","name":"Laguna XS 2.1","description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","attachment":false,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":true,"release_date":"2026-07-02","last_updated":"2026-07-02","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":32768},"benchmarks":[{"name":"SWE-Bench Verified","score":70.9,"metric":"resolved","harness":"Harbor","source":"https://poolside.ai/blog/introducing-laguna-xs-2-1","date":"2026-07-02"},{"name":"SWE-Bench Multilingual","score":63.1,"metric":"resolve rate","harness":"Harbor","source":"https://poolside.ai/blog/introducing-laguna-xs-2-1","date":"2026-07-02"},{"name":"SWE-Bench Pro","score":47.6,"metric":"resolve rate","harness":"Harbor","source":"https://poolside.ai/blog/introducing-laguna-xs-2-1","date":"2026-07-02"},{"name":"Terminal-Bench","score":37.5,"metric":"success rate","harness":"Harbor","version":"2.0","source":"https://poolside.ai/blog/introducing-laguna-xs-2-1","date":"2026-07-02"}]},"openai/o3":{"id":"openai/o3","name":"o3","description":"Deliberate o-series reasoner for hard math, coding, and multi-step analysis","family":"o","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05","release_date":"2025-04-16","last_updated":"2025-04-16","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000},"benchmarks":[{"name":"Aider Polyglot","score":81.3,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-06-25"}]},"openai/gpt-5.5-instant":{"id":"openai/gpt-5.5-instant","name":"GPT-5.5 Instant","description":"Compact GPT model for low-latency assistance and high-volume workloads","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-12-01","release_date":"2026-05-05","last_updated":"2026-05-28","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":400000,"output":128000}},"openai/gpt-5.2-pro":{"id":"openai/gpt-5.2-pro","name":"GPT-5.2 Pro","description":"Higher-accuracy GPT-5.2 variant for tougher reasoning and review workflows","family":"gpt-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":false,"knowledge":"2025-08-31","release_date":"2025-12-11","last_updated":"2025-12-11","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5":{"id":"openai/gpt-5","name":"GPT-5","description":"Original GPT-5 workhorse for reasoning, coding, writing, and tool workflows","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-08-07","last_updated":"2025-08-07","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000},"benchmarks":[{"name":"Aider Polyglot","score":88,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-08-23"},{"name":"SWE-Bench Pro","score":41.78,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"openai/gpt-3.5-turbo":{"id":"openai/gpt-3.5-turbo","name":"GPT-3.5-turbo","description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","attachment":false,"reasoning":false,"tool_call":false,"structured_output":false,"temperature":true,"knowledge":"2021-09-01","release_date":"2023-03-01","last_updated":"2023-11-06","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":16385,"output":4096},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":10.7,"metric":"index","source":"https://openrouter.ai/openai/gpt-3.5-turbo/benchmarks","date":"2026-03-11"}]},"openai/gpt-5-pro":{"id":"openai/gpt-5-pro","name":"GPT-5 Pro","description":"Higher-accuracy GPT-5 tier for tough analysis, coding reviews, and planning","family":"gpt-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-10-06","last_updated":"2025-10-06","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":272000}},"openai/gpt-4o":{"id":"openai/gpt-4o","name":"GPT-4o","description":"Omni-era GPT for multimodal chat, practical coding, and general assistants","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2023-09","release_date":"2024-05-13","last_updated":"2024-08-06","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384},"benchmarks":[{"name":"Aider Polyglot","score":23.1,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-30"}]},"openai/gpt-4":{"id":"openai/gpt-4","name":"GPT-4","description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":false,"temperature":true,"knowledge":"2023-11","release_date":"2023-11-06","last_updated":"2024-04-09","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":8192,"output":8192},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":13.1,"metric":"index","source":"https://openrouter.ai/openai/gpt-4/benchmarks","date":"2026-03-11"}]},"openai/o4-mini":{"id":"openai/o4-mini","name":"o4-mini","description":"Fast o-series model for compact reasoning, coding, and tool use","family":"o-mini","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05","release_date":"2025-04-16","last_updated":"2025-04-16","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000},"benchmarks":[{"name":"Aider Polyglot","score":72,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-04-16"}]},"openai/gpt-oss-safeguard-120b":{"id":"openai/gpt-oss-safeguard-120b","name":"GPT OSS Safeguard 120B","description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"gpt-oss","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2025-10-29","last_updated":"2025-10-29","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/openai/gpt-oss-safeguard-120b"}]},"openai/o3-pro":{"id":"openai/o3-pro","name":"o3-pro","description":"High-effort o3 tier for difficult technical reasoning and careful answers","family":"o-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05","release_date":"2025-06-10","last_updated":"2025-06-10","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000},"benchmarks":[{"name":"Aider Polyglot","score":84.9,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-06-28"}]},"openai/gpt-4o-2024-05-13":{"id":"openai/gpt-4o-2024-05-13","name":"GPT-4o (2024-05-13)","description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2023-09","release_date":"2024-05-13","last_updated":"2024-05-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":4096},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":24.2,"metric":"index","source":"https://openrouter.ai/openai/gpt-4o-2024-05-13/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":30.9,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-4o-2024-05-13/benchmarks","date":"2026-03-11"}]},"openai/gpt-5.4-nano":{"id":"openai/gpt-5.4-nano","name":"GPT-5.4 nano","description":"Cheapest GPT-5.4 lane for simple routing, extraction, and bulk automation","family":"gpt-nano","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2026-03-17","last_updated":"2026-03-17","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5-chat-latest":{"id":"openai/gpt-5-chat-latest","name":"GPT-5 Chat (latest)","description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":false,"structured_output":true,"temperature":true,"knowledge":"2024-09-30","release_date":"2025-08-07","last_updated":"2025-08-07","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5.1-codex":{"id":"openai/gpt-5.1-codex","name":"GPT-5.1 Codex","description":"Codex GPT for repository edits, code review, and practical software agents","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-11-13","last_updated":"2025-11-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5.1-codex-max":{"id":"openai/gpt-5.1-codex-max","name":"GPT-5.1 Codex Max","description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-11-13","last_updated":"2025-11-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5.3-chat-latest":{"id":"openai/gpt-5.3-chat-latest","name":"GPT-5.3 Chat (latest)","description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-08-31","release_date":"2026-03-03","last_updated":"2026-03-03","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384}},"openai/gpt-4o-2024-08-06":{"id":"openai/gpt-4o-2024-08-06","name":"GPT-4o (2024-08-06)","description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2023-09","release_date":"2024-08-06","last_updated":"2024-08-06","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384},"benchmarks":[{"name":"Aider Polyglot","score":23.1,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-30"},{"name":"Artificial Analysis Coding Index","score":16.6,"metric":"index","source":"https://openrouter.ai/openai/gpt-4o-2024-08-06/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":33.1,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-4o-2024-08-06/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":8.3,"metric":"success rate","source":"https://openrouter.ai/openai/gpt-4o-2024-08-06/benchmarks","date":"2026-03-11"}]},"openai/o3-mini":{"id":"openai/o3-mini","name":"o3-mini","description":"Smaller o-series reasoner for economical coding, math, and planning tasks","family":"o-mini","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05","release_date":"2024-12-20","last_updated":"2025-01-29","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000},"benchmarks":[{"name":"Aider Polyglot","score":60.4,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-01-31"}]},"openai/gpt-5.2":{"id":"openai/gpt-5.2","name":"GPT-5.2","description":"Reliable GPT generation for broad coding, writing, and tool-assisted product work","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2025-12-11","last_updated":"2025-12-11","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":29.94,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"openai/gpt-5.3-codex":{"id":"openai/gpt-5.3-codex","name":"GPT-5.3 Codex","description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2026-02-05","last_updated":"2026-02-05","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000},"benchmarks":[{"name":"SWE-Atlas Codebase QnA","score":32.6,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":42.38,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":38.98,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-tw"}]},"openai/gpt-5.6-luna":{"id":"openai/gpt-5.6-luna","name":"GPT-5.6 Luna","description":"Cost-efficient GPT-5.6 model for fast, high-volume workloads","family":"gpt-luna","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2026-02-16","release_date":"2026-07-09","last_updated":"2026-07-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":62.7,"metric":"resolve rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Terminal-Bench","score":84.7,"metric":"success rate","version":"2.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"DeepSWE","score":67.2,"metric":"resolve rate","version":"1.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"GPQA Diamond","score":92.3,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"FrontierMath","score":78.6,"metric":"accuracy","dataset":"Tier 1-3","version":"v2","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"BrowseComp","score":83.3,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"OSWorld","score":45.6,"metric":"success rate","version":"2.0","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"MMMU Pro","score":78.4,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Agents' Last Exam","score":50.3,"source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Toolathlon","score":53.4,"metric":"success rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Artificial Analysis Intelligence Index","score":51.2,"metric":"index score","variant":"max","version":"4.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"},{"name":"Artificial Analysis Coding Agent Index","score":74.6,"metric":"index score","harness":"Codex","variant":"max","version":"1.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"}]},"openai/gpt-5.1-codex-mini":{"id":"openai/gpt-5.1-codex-mini","name":"GPT-5.1 Codex mini","description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-11-13","last_updated":"2025-11-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-realtime-2.1":{"id":"openai/gpt-realtime-2.1","name":"GPT-Realtime-2.1","description":"Realtime speech-to-speech model with configurable reasoning, tool use, and robust voice-agent behavior","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":false,"knowledge":"2024-09-30","release_date":"2026-07-06","last_updated":"2026-07-06","modalities":{"input":["text","audio","image"],"output":["text","audio"]},"open_weights":false,"limit":{"context":128000,"input":96000,"output":32000}},"openai/gpt-5.6-terra":{"id":"openai/gpt-5.6-terra","name":"GPT-5.6 Terra","description":"Balanced GPT-5.6 model for capable, cost-efficient everyday work","family":"gpt-terra","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2026-02-16","release_date":"2026-07-09","last_updated":"2026-07-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":63.4,"metric":"resolve rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Terminal-Bench","score":87.4,"metric":"success rate","version":"2.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"DeepSWE","score":69.6,"metric":"resolve rate","version":"1.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"GPQA Diamond","score":92.9,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"FrontierMath","score":84.9,"metric":"accuracy","dataset":"Tier 1-3","version":"v2","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"BrowseComp","score":87.5,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"OSWorld","score":50.2,"metric":"success rate","version":"2.0","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"MMMU Pro","score":80.7,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Agents' Last Exam","score":50.4,"source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Toolathlon","score":53.1,"metric":"success rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Artificial Analysis Intelligence Index","score":55,"metric":"index score","variant":"max","version":"4.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"},{"name":"Artificial Analysis Coding Agent Index","score":77.4,"metric":"index score","harness":"Codex","variant":"max","version":"1.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"}]},"openai/gpt-5.1-chat-latest":{"id":"openai/gpt-5.1-chat-latest","name":"GPT-5.1 Chat","description":"Chat-tuned GPT-5.1 for polished assistants, writing, and product conversations","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-11-13","last_updated":"2025-11-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384}},"openai/gpt-5.2-chat-latest":{"id":"openai/gpt-5.2-chat-latest","name":"GPT-5.2 Chat","description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2025-12-11","last_updated":"2025-12-11","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384}},"openai/o4-mini-deep-research":{"id":"openai/o4-mini-deep-research","name":"o4-mini-deep-research","description":"Research model for long-horizon investigation, synthesis, and analytical reports","family":"o-mini","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2024-05","release_date":"2024-06-26","last_updated":"2024-06-26","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000}},"openai/gpt-image-1.5":{"id":"openai/gpt-image-1.5","name":"GPT-Image-1.5","description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"gpt-image","attachment":true,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2025-11-25","last_updated":"2025-11-25","modalities":{"input":["text","image"],"output":["text","image"]},"open_weights":false,"limit":{"context":0,"output":0}},"openai/gpt-4.1-nano":{"id":"openai/gpt-4.1-nano","name":"GPT-4.1 nano","description":"Tiny GPT-4.1 option for classification, routing, and very high-volume tasks","family":"gpt-nano","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-04-14","last_updated":"2025-04-14","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":1047576,"output":32768},"benchmarks":[{"name":"Aider Polyglot","score":8.9,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-04-14"}]},"openai/gpt-oss-120b":{"id":"openai/gpt-oss-120b","name":"GPT OSS 120B","description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2025-08-05","last_updated":"2025-08-05","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/openai/gpt-oss-120b"}]},"openai/gpt-4o-2024-11-20":{"id":"openai/gpt-4o-2024-11-20","name":"GPT-4o (2024-11-20)","description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2023-09","release_date":"2024-11-20","last_updated":"2024-11-20","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384},"benchmarks":[{"name":"Aider Polyglot","score":18.2,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-30"},{"name":"Artificial Analysis Coding Index","score":16.7,"metric":"index","source":"https://openrouter.ai/openai/gpt-4o-2024-11-20/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":33.3,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-4o-2024-11-20/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":8.3,"metric":"success rate","source":"https://openrouter.ai/openai/gpt-4o-2024-11-20/benchmarks","date":"2026-03-11"}]},"openai/o1":{"id":"openai/o1","name":"o1","description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2023-09","release_date":"2024-12-05","last_updated":"2024-12-05","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000},"benchmarks":[{"name":"Aider Polyglot","score":61.7,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-21"}]},"openai/o1-pro":{"id":"openai/o1-pro","name":"o1-pro","description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2023-09","release_date":"2025-03-19","last_updated":"2025-03-19","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000}},"openai/gpt-5.4":{"id":"openai/gpt-5.4","name":"GPT-5.4","description":"Agent-ready GPT for coding and computer-use workflows at a lower cost","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2026-03-05","last_updated":"2026-03-05","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":59.1,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"},{"name":"SWE-Atlas Codebase QnA","score":40.8,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Codebase QnA","score":36.3,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":44.29,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":44.36,"metric":"score","harness":"Codex CLI","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"SWE-Atlas Test Writing","score":40,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"Artificial Analysis Coding Agent Index","score":53.6,"metric":"average pass@1","harness":"Codex","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":72.4,"metric":"pass@1","harness":"Codex","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":18.4,"metric":"pass@1","harness":"Codex","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":69.8,"metric":"pass@1","harness":"Codex","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Artificial Analysis Coding Agent Index","score":52.2,"metric":"average pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":72.9,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":18.9,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":64.7,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":75.1,"metric":"success rate","version":"2.0","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GPQA Diamond","score":92.8,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":39.8,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":52.1,"metric":"accuracy","variant":"with tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"OSWorld-Verified","score":75,"metric":"success rate","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"BrowseComp","score":82.7,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GDPval","score":83,"metric":"wins or ties","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"ARC-AGI-2","score":73.3,"metric":"accuracy","variant":"Verified","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":47.6,"metric":"accuracy","dataset":"Tier 1-3","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":27.1,"metric":"accuracy","dataset":"Tier 4","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"MMMU Pro","score":81.2,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"}]},"openai/gpt-5.4-mini":{"id":"openai/gpt-5.4-mini","name":"GPT-5.4 mini","description":"Strong small GPT for coding subagents, quick tool use, and high-volume work","family":"gpt-mini","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2026-03-17","last_updated":"2026-03-17","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-4.1":{"id":"openai/gpt-4.1","name":"GPT-4.1","description":"Long-lived GPT workhorse for coding, instruction following, and production apps","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-04-14","last_updated":"2025-04-14","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1047576,"output":32768},"benchmarks":[{"name":"Aider Polyglot","score":52.4,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-04-14"}]},"openai/whisper-large-v3-turbo":{"id":"openai/whisper-large-v3-turbo","name":"Whisper Large v3 Turbo","description":"Speech transcription model for accurate audio-to-text and captioning workflows","family":"whisper","attachment":false,"reasoning":false,"tool_call":false,"release_date":"2024-10-01","last_updated":"2024-10-01","modalities":{"input":["audio"],"output":["text"]},"open_weights":true,"limit":{"context":448,"output":448}},"openai/o3-deep-research":{"id":"openai/o3-deep-research","name":"o3-deep-research","description":"Research model for long-horizon investigation, synthesis, and analytical reports","family":"o","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2024-05","release_date":"2024-06-26","last_updated":"2024-06-26","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":100000}},"openai/gpt-5-mini":{"id":"openai/gpt-5-mini","name":"GPT-5 Mini","description":"Small GPT-5 for responsive agents, coding help, and everyday automation","family":"gpt-mini","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05-30","release_date":"2025-08-07","last_updated":"2025-08-07","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-image-1":{"id":"openai/gpt-image-1","name":"GPT-Image-1","description":"OpenAI image model for production generation, edits, and brand-safe visual workflows","family":"gpt-image","attachment":true,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2025-04-24","last_updated":"2025-04-24","modalities":{"input":["text","image"],"output":["image"]},"open_weights":false,"limit":{"context":0,"output":0}},"openai/gpt-4.1-mini":{"id":"openai/gpt-4.1-mini","name":"GPT-4.1 mini","description":"Affordable GPT-4.1 lane for fast coding help and structured extraction","family":"gpt-mini","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-04-14","last_updated":"2025-04-14","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1047576,"output":32768},"benchmarks":[{"name":"Aider Polyglot","score":32.4,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-04-14"}]},"openai/gpt-4-turbo":{"id":"openai/gpt-4-turbo","name":"GPT-4 Turbo","description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","attachment":true,"reasoning":false,"tool_call":true,"structured_output":false,"temperature":true,"knowledge":"2023-12","release_date":"2023-11-06","last_updated":"2024-04-09","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":4096},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":21.5,"metric":"index","source":"https://openrouter.ai/openai/gpt-4-turbo/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":31.9,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-4-turbo/benchmarks","date":"2026-03-11"}]},"openai/gpt-5-nano":{"id":"openai/gpt-5-nano","name":"GPT-5 Nano","description":"Tiny GPT-5 lane for routing, extraction, classification, and bulk jobs","family":"gpt-nano","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-05-30","release_date":"2025-08-07","last_updated":"2025-08-07","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5.4-pro":{"id":"openai/gpt-5.4-pro","name":"GPT-5.4 Pro","description":"More exact GPT-5.4 tier for demanding professional reasoning and agent tasks","family":"gpt-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":false,"temperature":false,"knowledge":"2025-08-31","release_date":"2026-03-05","last_updated":"2026-03-05","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"GPQA Diamond","score":94.4,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":42.7,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":58.7,"metric":"accuracy","variant":"with tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"BrowseComp","score":89.3,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GDPval","score":82,"metric":"wins or ties","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":50,"metric":"accuracy","dataset":"Tier 1-3","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":38,"metric":"accuracy","dataset":"Tier 4","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"ARC-AGI-1","score":94.5,"metric":"accuracy","variant":"Verified","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"ARC-AGI-2","score":83.3,"metric":"accuracy","variant":"Verified","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FinanceAgent","score":61.5,"metric":"accuracy","version":"1.1","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GeneBench","score":25.6,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"}]},"openai/whisper-large-v3":{"id":"openai/whisper-large-v3","name":"Whisper 3 Large","description":"Open Whisper checkpoint for robust multilingual transcription and captioning","family":"whisper","attachment":false,"reasoning":false,"tool_call":false,"release_date":"2024-10-01","last_updated":"2024-10-01","modalities":{"input":["audio"],"output":["text"]},"open_weights":true,"limit":{"context":448,"output":4096}},"openai/gpt-5.5-pro":{"id":"openai/gpt-5.5-pro","name":"GPT-5.5 Pro","description":"Highest-accuracy GPT-5.5 tier for slower, precision-heavy reasoning and coding","family":"gpt-pro","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-12-01","release_date":"2026-04-23","last_updated":"2026-04-23","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"BrowseComp","score":90.1,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":43.1,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":57.2,"metric":"accuracy","variant":"with tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":52.4,"metric":"accuracy","dataset":"Tier 1-3","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":39.6,"metric":"accuracy","dataset":"Tier 4","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GDPval","score":82.3,"metric":"wins or ties","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GeneBench","score":33.2,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"}]},"openai/gpt-4o-mini":{"id":"openai/gpt-4o-mini","name":"GPT-4o mini","description":"Small omni GPT for cheap multimodal assistance and production-scale traffic","family":"gpt-mini","attachment":true,"reasoning":false,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2023-09","release_date":"2024-07-18","last_updated":"2024-07-18","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":16384},"benchmarks":[{"name":"Aider Polyglot","score":3.6,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-21"},{"name":"SciCode","score":22.9,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-4o-mini/benchmarks","date":"2026-03-11"}]},"openai/gpt-oss-20b":{"id":"openai/gpt-oss-20b","name":"GPT OSS 20B","description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2025-08-05","last_updated":"2025-08-05","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/openai/gpt-oss-20b"}]},"openai/gpt-5.6-sol":{"id":"openai/gpt-5.6-sol","name":"GPT-5.6 Sol","description":"Frontier GPT-5.6 model for complex professional work, coding, and agentic workflows","family":"gpt-sol","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2026-02-16","release_date":"2026-07-09","last_updated":"2026-07-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":64.6,"metric":"resolve rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Terminal-Bench","score":88.8,"metric":"success rate","version":"2.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"DeepSWE","score":72.7,"metric":"resolve rate","version":"1.1","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"GPQA Diamond","score":94.6,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"FrontierMath","score":89,"metric":"accuracy","dataset":"Tier 1-3","version":"v2","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"BrowseComp","score":90.4,"metric":"accuracy","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"OSWorld","score":62.6,"metric":"success rate","version":"2.0","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"MMMU Pro","score":83,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Agents' Last Exam","score":52.7,"source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Toolathlon","score":58,"metric":"success rate","source":"https://openai.com/index/gpt-5-6/","date":"2026-07-09"},{"name":"Artificial Analysis Intelligence Index","score":58.9,"metric":"index score","variant":"max","version":"4.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"},{"name":"Artificial Analysis Coding Agent Index","score":80,"metric":"index score","harness":"Codex","variant":"max","version":"1.1","source":"https://artificialanalysis.ai/articles/gpt-5-6-has-landed","date":"2026-07-09"}]},"openai/gpt-5-codex":{"id":"openai/gpt-5-codex","name":"GPT-5-Codex","description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-09-15","last_updated":"2025-09-15","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":38.9,"metric":"index","source":"https://openrouter.ai/openai/gpt-5-codex/benchmarks","date":"2026-06-01"},{"name":"SciCode","score":40.9,"metric":"percent correct","source":"https://openrouter.ai/openai/gpt-5-codex/benchmarks","date":"2026-06-01"},{"name":"Terminal-Bench Hard","score":37.9,"metric":"success rate","source":"https://openrouter.ai/openai/gpt-5-codex/benchmarks","date":"2026-06-01"}]},"openai/gpt-5.2-codex":{"id":"openai/gpt-5.2-codex","name":"GPT-5.2 Codex","description":"Code-specialist GPT for repository edits, reviews, and long-running software agents","family":"gpt-codex","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-08-31","release_date":"2025-12-11","last_updated":"2025-12-11","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":41.04,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"openai/gpt-image-2":{"id":"openai/gpt-image-2","name":"GPT-Image-2","description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"gpt-image","attachment":true,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2026-04-21","last_updated":"2026-04-21","modalities":{"input":["text","image"],"output":["image"]},"open_weights":false,"limit":{"context":0,"output":0}},"openai/gpt-5.1":{"id":"openai/gpt-5.1","name":"GPT-5.1","description":"Sharper GPT-5 generation for coding, product work, and tool-assisted tasks","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2024-09-30","release_date":"2025-11-13","last_updated":"2025-11-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":400000,"input":272000,"output":128000}},"openai/gpt-5.5":{"id":"openai/gpt-5.5","name":"GPT-5.5","description":"Default frontier GPT for coding, computer use, research, and knowledge work","family":"gpt","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"knowledge":"2025-12-01","release_date":"2026-04-23","last_updated":"2026-04-23","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1050000,"input":922000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":58.6,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"Terminal-Bench","score":78.2,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"SWE-Atlas Codebase QnA","score":45.43,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":44.79,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":42.59,"metric":"score","harness":"Codex","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"Artificial Analysis Coding Agent Index","score":65.3,"metric":"average pass@1","harness":"Codex","variant":"xhigh","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":80.8,"metric":"pass@1","harness":"Codex","variant":"xhigh","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":30.9,"metric":"pass@1","harness":"Codex","variant":"xhigh","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":84.1,"metric":"pass@1","harness":"Codex","variant":"xhigh","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Artificial Analysis Coding Agent Index","score":60.4,"metric":"average pass@1","harness":"Codex","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":79.1,"metric":"pass@1","harness":"Codex","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":26.2,"metric":"pass@1","harness":"Codex","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":75.8,"metric":"pass@1","harness":"Codex","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Artificial Analysis Coding Agent Index","score":57.8,"metric":"average pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":75,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":24.9,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":73.4,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":82.7,"metric":"success rate","version":"2.0","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GPQA Diamond","score":93.6,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":41.4,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":52.2,"metric":"accuracy","variant":"with tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"OSWorld-Verified","score":78.7,"metric":"success rate","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"BrowseComp","score":84.4,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"MMMU Pro","score":81.2,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"ARC-AGI-2","score":85,"metric":"accuracy","variant":"Verified","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":51.7,"metric":"accuracy","dataset":"Tier 1-3","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"FrontierMath","score":35.4,"metric":"accuracy","dataset":"Tier 4","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"GDPval","score":84.9,"metric":"wins or ties","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"MCP Atlas","score":75.3,"metric":"success rate","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Toolathlon","score":55.6,"metric":"success rate","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"τ²-Bench Telecom","score":98,"metric":"success rate","variant":"original prompts","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"}]},"deepreinforce/ornith-1.0-31b":{"id":"deepreinforce/ornith-1.0-31b","name":"Ornith 1.0 31B","description":"Open coding-reasoning model for repository tasks and self-improving agents","family":"ornith","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-25","last_updated":"2026-06-25","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144},"license":"MIT","links":[{"label":"Announcement","url":"https://deep-reinforce.com/ornith_1_0.html","type":"announcement"}]},"deepreinforce/ornith-1.0-35b":{"id":"deepreinforce/ornith-1.0-35b","name":"Ornith 1.0 35B","description":"Large coding-reasoning model for agentic software tasks and RL search","family":"ornith","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-25","last_updated":"2026-06-25","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144},"license":"MIT","links":[{"label":"Model card","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B","type":"model_card"},{"label":"Announcement","url":"https://deep-reinforce.com/ornith_1_0.html","type":"announcement"}],"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":75.6,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"SWE-Bench Pro","score":50.4,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"SWE-Bench Multilingual","score":69.3,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"Terminal-Bench 2.1","score":64.2,"metric":"percent","variant":"Terminus-2","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"Terminal-Bench 2.1","score":62.8,"metric":"percent","variant":"Claude Code","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"NL2Repo","score":34.6,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"},{"name":"Claw-eval","score":69.8,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B"}]},"deepreinforce/ornith-1.0-9b":{"id":"deepreinforce/ornith-1.0-9b","name":"Ornith 1.0 9B","description":"Open coding-reasoning model for repository tasks and self-improving agents","family":"ornith","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-25","last_updated":"2026-06-25","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144},"license":"MIT","links":[{"label":"Model card","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B","type":"model_card"},{"label":"Announcement","url":"https://deep-reinforce.com/ornith_1_0.html","type":"announcement"}],"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":69.4,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"SWE-Bench Pro","score":42.9,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"SWE-Bench Multilingual","score":52,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"Terminal-Bench 2.1","score":43.1,"metric":"percent","variant":"Terminus-2","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"Terminal-Bench 2.1","score":40.6,"metric":"percent","variant":"Claude Code","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"NL2Repo","score":27.2,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"},{"name":"Claw-eval","score":63.1,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B"}]},"deepreinforce/ornith-1.0-397b":{"id":"deepreinforce/ornith-1.0-397b","name":"Ornith 1.0 397B","description":"Large coding-reasoning model for agentic software tasks and RL search","family":"ornith","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-25","last_updated":"2026-06-25","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":262144},"license":"MIT","links":[{"label":"Model card","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B","type":"model_card"},{"label":"Announcement","url":"https://deep-reinforce.com/ornith_1_0.html","type":"announcement"}],"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"label":"Hugging Face (FP8)","url":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B-FP8","quantization":"fp8"}],"benchmarks":[{"name":"SWE-Bench Verified","score":82.4,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"SWE-Bench Pro","score":62.2,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"SWE-Bench Multilingual","score":78.9,"metric":"percent resolved","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"Terminal-Bench 2.1","score":77.5,"metric":"percent","variant":"Terminus-2","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"Terminal-Bench 2.1","score":78.2,"metric":"percent","variant":"Claude Code","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"NL2Repo","score":48.2,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"},{"name":"Claw-eval","score":77.1,"metric":"percent","source":"https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B"}]},"sakana/fugu":{"id":"sakana/fugu","name":"Fugu","description":"Multi-agent model for routing expert agents across complex analytical tasks","family":"fugu","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"release_date":"2026-06-15","last_updated":"2026-06-15","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":1000000},"links":[{"label":"Official model catalog","url":"https://raw.githubusercontent.com/SakanaAI/fugu/refs/heads/main/configs/files/fugu.json","type":"docs"}],"benchmarks":[{"name":"SWE Bench Pro","score":59,"source":"https://console.sakana.ai/models"},{"name":"Terminal Bench 2.1","score":80.2,"source":"https://console.sakana.ai/models"},{"name":"LiveCodeBench","score":92.9,"source":"https://console.sakana.ai/models"},{"name":"LiveCodeBench Pro","score":87.8,"source":"https://console.sakana.ai/models"},{"name":"Humanity’s Last Exam","score":47.2,"source":"https://console.sakana.ai/models"},{"name":"CharXiv Reasoning","score":85.1,"source":"https://console.sakana.ai/models"},{"name":"GPQA Diamond","score":95.5,"source":"https://console.sakana.ai/models"},{"name":"SciCode","score":60.1,"source":"https://console.sakana.ai/models"},{"name":"τ3 Banking","score":21.7,"source":"https://console.sakana.ai/models"},{"name":"Long Context Reasoning","score":74.7,"source":"https://console.sakana.ai/models"},{"name":"MRCRv2","score":86.6,"source":"https://console.sakana.ai/models"},{"name":"CTI-REALM","score":67.5,"source":"https://console.sakana.ai/models"}]},"sakana/fugu-ultra":{"id":"sakana/fugu-ultra","name":"Fugu Ultra","description":"Quality-first multi-agent model for hard research, analysis, and competitions","family":"fugu","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":false,"release_date":"2026-06-15","last_updated":"2026-06-15","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":1000000},"links":[{"label":"Official model catalog","url":"https://raw.githubusercontent.com/SakanaAI/fugu/refs/heads/main/configs/files/fugu.json","type":"docs"}],"benchmarks":[{"name":"SWE Bench Pro","score":73.7,"source":"https://console.sakana.ai/models"},{"name":"Terminal Bench 2.1","score":82.1,"source":"https://console.sakana.ai/models"},{"name":"LiveCodeBench","score":93.2,"source":"https://console.sakana.ai/models"},{"name":"LiveCodeBench Pro","score":90.8,"source":"https://console.sakana.ai/models"},{"name":"Humanity’s Last Exam","score":50,"source":"https://console.sakana.ai/models"},{"name":"CharXiv Reasoning","score":86.6,"source":"https://console.sakana.ai/models"},{"name":"GPQA Diamond","score":95.5,"source":"https://console.sakana.ai/models"},{"name":"SciCode","score":58.7,"source":"https://console.sakana.ai/models"},{"name":"τ3 Banking","score":20.6,"source":"https://console.sakana.ai/models"},{"name":"Long Context Reasoning","score":73.3,"source":"https://console.sakana.ai/models"},{"name":"MRCRv2","score":93.6,"source":"https://console.sakana.ai/models"},{"name":"CTI-REALM","score":69.4,"source":"https://console.sakana.ai/models"}]},"nvidia/llama-nemotron-embed-vl-1b-v2":{"id":"nvidia/llama-nemotron-embed-vl-1b-v2","name":"Llama Nemotron Embed VL 1B v2","description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","family":"nemotron","attachment":true,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2026-02-10","last_updated":"2026-02-10","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":32768,"output":2048}},"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning":{"id":"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning","name":"Nemotron 3 Nano Omni 30B A3B Reasoning","description":"Open Nemotron omni model combining reasoning with text, vision, and audio","family":"nemotron","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-04-28","last_updated":"2026-04-28","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":65536}},"nvidia/nemotron-cascade-2-30b-a3b":{"id":"nvidia/nemotron-cascade-2-30b-a3b","name":"Nemotron Cascade 2 30B A3B","description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-03-24","last_updated":"2026-04-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":32768}},"nvidia/nemotron-content-safety-reasoning-4b":{"id":"nvidia/nemotron-content-safety-reasoning-4b","name":"Nemotron Content Safety Reasoning 4B","description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","attachment":false,"reasoning":true,"tool_call":false,"temperature":false,"release_date":"2026-01-22","last_updated":"2026-01-22","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4096}},"nvidia/nemotron-3.5-content-safety":{"id":"nvidia/nemotron-3.5-content-safety","name":"Nemotron 3.5 Content Safety","description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"release_date":"2026-06-04","last_updated":"2026-06-04","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/nemotron-voicechat":{"id":"nvidia/nemotron-voicechat","name":"Nemotron VoiceChat","description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"release_date":"2026-03-16","last_updated":"2026-03-16","modalities":{"input":["text","audio"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/nemotron-3-ultra-550b-a55b":{"id":"nvidia/nemotron-3-ultra-550b-a55b","name":"Nemotron 3 Ultra 550B A55B","description":"Largest Nemotron 3 model for maximum open-weight reasoning and agent accuracy","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-04","last_updated":"2026-06-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Verified","score":70.7,"metric":"resolved","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"SWE-Bench Multilingual","score":67.7,"metric":"resolve rate","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"Terminal-Bench","score":56.4,"metric":"success rate","version":"2.1","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"GPQA","score":87,"metric":"accuracy","variant":"no tools","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"Humanity's Last Exam","score":26.7,"metric":"accuracy","variant":"no tools","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"Humanity's Last Exam","score":37.4,"metric":"accuracy","variant":"with tools","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"LiveCodeBench","score":89,"metric":"pass@1","version":"v6","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"MMLU-Pro","score":86.8,"metric":"accuracy","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"BrowseComp","score":44.4,"metric":"accuracy","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"IFBench","score":81.7,"metric":"accuracy","variant":"prompt loose","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"},{"name":"GDPval","score":46.7,"metric":"wins or ties","source":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16","date":"2026-06-04"}]},"nvidia/llama-3.3-nemotron-super-49b-v1":{"id":"nvidia/llama-3.3-nemotron-super-49b-v1","name":"Llama 3.3 Nemotron Super 49B v1","description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-04-07","last_updated":"2025-04-07","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":131072}},"nvidia/nemotron-3-nano-30b-a3b":{"id":"nvidia/nemotron-3-nano-30b-a3b","name":"Nemotron 3 Nano 30B A3B","description":"Small Nemotron 3 MoE for efficient coding, math, and long-context agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-12-15","last_updated":"2025-12-15","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144}},"nvidia/llama-3.3-nemotron-super-49b-v1.5":{"id":"nvidia/llama-3.3-nemotron-super-49b-v1.5","name":"Llama 3.3 Nemotron Super 49B v1.5","description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-07-25","last_updated":"2025-07-25","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":131072}},"nvidia/nemotron-nano-9b-v2":{"id":"nvidia/nemotron-nano-9b-v2","name":"Nemotron Nano 9B v2","description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-08-18","last_updated":"2025-08-18","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":131072}},"nvidia/mistral-nemotron":{"id":"nvidia/mistral-nemotron","name":"Mistral Nemotron","description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"nemotron","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"release_date":"2025-06-11","last_updated":"2025-06-12","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/llama-3.1-nemotron-70b-instruct":{"id":"nvidia/llama-3.1-nemotron-70b-instruct","name":"Llama 3.1 Nemotron 70B Instruct","description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"release_date":"2025-04-15","last_updated":"2025-04-15","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/llama-3.1-nemotron-ultra-253b":{"id":"nvidia/llama-3.1-nemotron-ultra-253b","name":"Llama 3.1 Nemotron Ultra 253B","description":"Flagship Nemotron model for high-throughput reasoning and complex agents","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-04-07","last_updated":"2025-04-07","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/nemotron-mini-4b-instruct":{"id":"nvidia/nemotron-mini-4b-instruct","name":"Nemotron Mini 4B Instruct","description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"release_date":"2024-08-21","last_updated":"2024-08-26","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":8192}},"nvidia/llama-nemotron-rerank-vl-1b-v2":{"id":"nvidia/llama-nemotron-rerank-vl-1b-v2","name":"Llama Nemotron Rerank VL 1B v2","description":"Reranking model for improving retrieval quality in search and recommendation systems","family":"nemotron","attachment":true,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2026-03-31","last_updated":"2026-03-31","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4096}},"nvidia/llama-3.1-nemotron-safety-guard-8b-v3":{"id":"nvidia/llama-3.1-nemotron-safety-guard-8b-v3","name":"Llama 3.1 Nemotron Safety Guard 8B v3","description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","attachment":false,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2025-10-28","last_updated":"2025-10-28","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4096}},"nvidia/nemotron-3-super-120b-a12b":{"id":"nvidia/nemotron-3-super-120b-a12b","name":"Nemotron 3 Super 120B A12B","description":"Nemotron middle tier for collaborative agents and high-volume reasoning workloads","family":"nemotron","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-03-11","last_updated":"2026-03-11","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":262144}},"nvidia/nemotron-3-content-safety":{"id":"nvidia/nemotron-3-content-safety","name":"Nemotron 3 Content Safety","description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","attachment":false,"reasoning":false,"tool_call":false,"temperature":false,"release_date":"2026-04-16","last_updated":"2026-04-16","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4096}},"nvidia/nemotron-nano-12b-v2-vl":{"id":"nvidia/nemotron-nano-12b-v2-vl","name":"Nemotron Nano 12B v2 VL","description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-10-28","last_updated":"2025-10-28","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000}},"xiaomi/mimo-v2.5-pro-ultraspeed":{"id":"xiaomi/mimo-v2.5-pro-ultraspeed","name":"MiMo-V2.5-Pro-UltraSpeed","description":"MiMo pro model for strong multimodal reasoning and agent execution","family":"mimo","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12","release_date":"2026-06-08","last_updated":"2026-06-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1048576,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash"}]},"xiaomi/mimo-v2.5":{"id":"xiaomi/mimo-v2.5","name":"MiMo-V2.5","description":"Open MiMo model for multimodal coding agents and long-context automation","family":"mimo","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12","release_date":"2026-04-22","last_updated":"2026-04-22","modalities":{"input":["text","image","audio","video"],"output":["text"]},"open_weights":true,"limit":{"context":1048576,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5"}]},"xiaomi/mimo-v2-omni":{"id":"xiaomi/mimo-v2-omni","name":"MiMo-V2-Omni","description":"MiMo omni model for text, image, video, audio, and agents","family":"mimo","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12","release_date":"2026-03-18","last_updated":"2026-03-18","modalities":{"input":["text","image","audio","video","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":262144,"output":131072}},"xiaomi/mimo-v2-flash":{"id":"xiaomi/mimo-v2-flash","name":"MiMo-V2-Flash","description":"MiMo flash model for fast multimodal assistance and agent workflows","family":"mimo","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12-01","release_date":"2025-12-16","last_updated":"2026-02-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/XiaomiMiMo/MiMo-V2-Flash"}]},"xiaomi/mimo-v2-pro":{"id":"xiaomi/mimo-v2-pro","name":"MiMo-V2-Pro","description":"Earlier MiMo Pro model for multimodal agents, reasoning, and code tasks","family":"mimo","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12","release_date":"2026-03-18","last_updated":"2026-03-18","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":131072}},"xiaomi/mimo-v2.5-pro":{"id":"xiaomi/mimo-v2.5-pro","name":"MiMo-V2.5-Pro","description":"Stronger MiMo Pro tier for multimodal reasoning and coding-agent execution","family":"mimo","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-12","release_date":"2026-04-22","last_updated":"2026-04-22","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1048576,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro"}],"benchmarks":[{"name":"SWE-Bench Verified","score":78.9,"metric":"resolved","source":"https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro"},{"name":"SWE-Bench Pro","score":57.2,"metric":"resolve rate","source":"https://mimo.xiaomi.com/mimo-v2-5-pro/","date":"2026-04-22"},{"name":"GPQA Diamond","score":86.6,"metric":"accuracy","source":"https://mimo.xiaomi.com/mimo-v2-5-pro/","date":"2026-04-22"}]},"anthropic/claude-opus-4-5":{"id":"anthropic/claude-opus-4-5","name":"Claude Opus 4.5 (latest)","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-05","release_date":"2025-11-24","last_updated":"2025-11-24","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000}},"anthropic/claude-haiku-4-5-20251001":{"id":"anthropic/claude-haiku-4-5-20251001","name":"Claude Haiku 4.5","description":"Fast Claude model for responsive assistance, classification, and lightweight agents","family":"claude-haiku","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-02-28","release_date":"2025-10-15","last_updated":"2025-10-15","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000}},"anthropic/claude-3-5-haiku-20241022":{"id":"anthropic/claude-3-5-haiku-20241022","name":"Claude Haiku 3.5","description":"Fast Claude model for responsive assistance, classification, and lightweight agents","family":"claude-haiku","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-07-31","release_date":"2024-10-22","last_updated":"2024-10-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":8192},"benchmarks":[{"name":"Aider Polyglot","score":28,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2024-12-21"}]},"anthropic/claude-opus-4-0":{"id":"anthropic/claude-opus-4-0","name":"Claude Opus 4 (latest)","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-05-22","last_updated":"2025-05-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":32000},"benchmarks":[{"name":"Aider Polyglot","score":72,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-25"}]},"anthropic/claude-opus-4-1-20250805":{"id":"anthropic/claude-opus-4-1-20250805","name":"Claude Opus 4.1","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-08-05","last_updated":"2025-08-05","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":32000}},"anthropic/claude-sonnet-4-5":{"id":"anthropic/claude-sonnet-4-5","name":"Claude Sonnet 4.5 (latest)","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-07-31","release_date":"2025-09-29","last_updated":"2025-09-29","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"SWE-Bench Pro","score":43.6,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"anthropic/claude-opus-4-7":{"id":"anthropic/claude-opus-4-7","name":"Claude Opus 4.7","description":"Stronger Opus tier for advanced software work and high-stakes reasoning","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2026-01-31","release_date":"2026-04-16","last_updated":"2026-04-16","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":64.3,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"Terminal-Bench","score":66.1,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"SWE-Atlas Refactoring","score":48.57,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"Artificial Analysis Coding Agent Index","score":66.6,"metric":"average pass@1","harness":"Claude Code","variant":"max","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":81,"metric":"pass@1","harness":"Claude Code","variant":"max","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":44.9,"metric":"pass@1","harness":"Claude Code","variant":"max","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":73.8,"metric":"pass@1","harness":"Claude Code","variant":"max","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Artificial Analysis Coding Agent Index","score":61.2,"metric":"average pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":78.4,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":34.4,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":70.6,"metric":"pass@1","harness":"Cursor CLI","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Artificial Analysis Coding Agent Index","score":59.9,"metric":"average pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":71.7,"metric":"pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":36.4,"metric":"pass@1","harness":"Claude Code","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":71.4,"metric":"pass@1","harness":"Claude Code","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"GPQA Diamond","score":94.2,"metric":"accuracy","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":46.9,"metric":"accuracy","variant":"no tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"Humanity's Last Exam","score":54.7,"metric":"accuracy","variant":"with tools","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"},{"name":"OSWorld-Verified","score":78,"metric":"success rate","source":"https://openai.com/index/introducing-gpt-5-5/","date":"2026-04-23"}]},"anthropic/claude-sonnet-5":{"id":"anthropic/claude-sonnet-5","name":"Claude Sonnet 5","description":"Everyday Claude agent model for coding, planning, browsing, and general work","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2026-01-31","release_date":"2026-06-30","last_updated":"2026-06-30","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Verified","score":85.2,"metric":"resolved","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"SWE-Bench Pro","score":63.2,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"SWE-Bench Multilingual","score":78.3,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"Terminal-Bench","score":80.4,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"OSWorld-Verified","score":81.2,"metric":"success rate","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"BrowseComp","score":84.7,"metric":"accuracy","variant":"single agent","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"FrontierCode","score":38.8,"metric":"pass rate","version":"v1","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"}]},"anthropic/claude-opus-4-5-20251101":{"id":"anthropic/claude-opus-4-5-20251101","name":"Claude Opus 4.5","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-05","release_date":"2025-11-01","last_updated":"2025-11-01","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"SWE-Bench Pro","score":45.89,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"anthropic/claude-3-5-sonnet-20241022":{"id":"anthropic/claude-3-5-sonnet-20241022","name":"Claude Sonnet 3.5 v2","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04-30","release_date":"2024-10-22","last_updated":"2024-10-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":8192},"benchmarks":[{"name":"Aider Polyglot","score":51.6,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-01-17"}]},"anthropic/claude-opus-4-8":{"id":"anthropic/claude-opus-4-8","name":"Claude Opus 4.8","description":"Top Claude Opus tier for the hardest reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2026-01","release_date":"2026-05-28","last_updated":"2026-05-28","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":69.2,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"Terminal-Bench","score":74.6,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-opus-4-8","date":"2026-05-28"},{"name":"SWE-Bench Verified","score":88.6,"metric":"resolved","source":"https://benchlm.ai/benchmarks/sweVerified"},{"name":"Humanity's Last Exam","score":49.8,"metric":"accuracy","variant":"no tools","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"Humanity's Last Exam","score":57.9,"metric":"accuracy","variant":"with tools","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"OSWorld-Verified","score":83.4,"metric":"success rate","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"FrontierCode","score":13.4,"metric":"pass rate","variant":"high effort","dataset":"Diamond","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"}]},"anthropic/claude-opus-4-20250514":{"id":"anthropic/claude-opus-4-20250514","name":"Claude Opus 4","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-05-22","last_updated":"2025-05-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":32000},"benchmarks":[{"name":"Aider Polyglot","score":72,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-25"}]},"anthropic/claude-sonnet-4-20250514":{"id":"anthropic/claude-sonnet-4-20250514","name":"Claude Sonnet 4","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-05-22","last_updated":"2025-05-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"Aider Polyglot","score":61.3,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-24"}]},"anthropic/claude-opus-4-1":{"id":"anthropic/claude-opus-4-1","name":"Claude Opus 4.1 (latest)","description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-08-05","last_updated":"2025-08-05","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":32000}},"anthropic/claude-3-haiku-20240307":{"id":"anthropic/claude-3-haiku-20240307","name":"Claude Haiku 3","description":"Legacy model retained for compatibility with older integrations","family":"claude-haiku","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2023-08-31","release_date":"2024-03-13","last_updated":"2024-03-13","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":4096}},"anthropic/claude-fable-5":{"id":"anthropic/claude-fable-5","name":"Claude Fable 5","description":"Claude model for creative writing, analysis, and controlled agent workflows","family":"claude-fable","attachment":true,"reasoning":true,"tool_call":true,"temperature":false,"knowledge":"2026-01-31","release_date":"2026-06-09","last_updated":"2026-06-09","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":80.3,"metric":"resolve rate","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"SWE-Bench Verified","score":95,"metric":"resolved","source":"https://benchlm.ai/benchmarks/sweVerified"},{"name":"Terminal-Bench","score":88,"metric":"success rate","version":"2.1","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"Humanity's Last Exam","score":59,"metric":"accuracy","variant":"no tools","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"Humanity's Last Exam","score":64.5,"metric":"accuracy","variant":"with tools","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"OSWorld-Verified","score":85,"metric":"success rate","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"FrontierCode","score":29.3,"metric":"pass rate","variant":"high effort","dataset":"Diamond","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"GDPval-AA","score":1932,"metric":"Elo","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"},{"name":"AutomationBench","score":17.4,"metric":"success rate","source":"https://www.anthropic.com/news/claude-fable-5-mythos-5","date":"2026-06-09"}]},"anthropic/claude-sonnet-4-0":{"id":"anthropic/claude-sonnet-4-0","name":"Claude Sonnet 4 (latest)","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-03-31","release_date":"2025-05-22","last_updated":"2025-05-22","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"Aider Polyglot","score":61.3,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-24"},{"name":"SWE-Bench Pro","score":42.7,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"anthropic/claude-3-7-sonnet-20250219":{"id":"anthropic/claude-3-7-sonnet-20250219","name":"Claude Sonnet 3.7","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-10-31","release_date":"2025-02-19","last_updated":"2025-02-19","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"Aider Polyglot","score":64.9,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-02-24"}]},"anthropic/claude-haiku-4-5":{"id":"anthropic/claude-haiku-4-5","name":"Claude Haiku 4.5 (latest)","description":"Fast Claude lane for lightweight agents, office tasks, and responsive chat","family":"claude-haiku","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-02-28","release_date":"2025-10-15","last_updated":"2025-10-15","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000},"benchmarks":[{"name":"SWE-Bench Pro","score":39.45,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"anthropic/claude-opus-4-6":{"id":"anthropic/claude-opus-4-6","name":"Claude Opus 4.6","description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-05-31","release_date":"2026-02-05","last_updated":"2026-03-13","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":128000},"benchmarks":[{"name":"SWE-Bench Pro","score":51.9,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"},{"name":"SWE-Atlas Codebase QnA","score":33.3,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Codebase QnA","score":30,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":35.58,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":36.67,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"SWE-Atlas Test Writing","score":36.08,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"Artificial Analysis Coding Agent Index","score":51.3,"metric":"average pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":71.9,"metric":"pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":11.8,"metric":"pass@1","harness":"Claude Code","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":70.2,"metric":"pass@1","harness":"Claude Code","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"}]},"anthropic/claude-sonnet-4-5-20250929":{"id":"anthropic/claude-sonnet-4-5-20250929","name":"Claude Sonnet 4.5","description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-07-31","release_date":"2025-09-29","last_updated":"2025-09-29","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":64000}},"anthropic/claude-sonnet-4-6":{"id":"anthropic/claude-sonnet-4-6","name":"Claude Sonnet 4.6","description":"Claude workhorse for coding agents, careful analysis, and production cost control","family":"claude-sonnet","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-08-31","release_date":"2026-02-17","last_updated":"2026-03-13","modalities":{"input":["text","image","pdf"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":64000},"benchmarks":[{"name":"SWE-Atlas Codebase QnA","score":31.2,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":32.21,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":31.76,"metric":"score","harness":"Claude Code","source":"https://labs.scale.com/leaderboard/sweatlas-tw"},{"name":"Artificial Analysis Coding Agent Index","score":49.4,"metric":"average pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":70.3,"metric":"pass@1","harness":"Claude Code","variant":"medium","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":14.9,"metric":"pass@1","harness":"Claude Code","variant":"medium","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":63.1,"metric":"pass@1","harness":"Claude Code","variant":"medium","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":67,"metric":"success rate","harness":"Terminus-2","version":"2.1","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"Humanity's Last Exam","score":34.6,"metric":"accuracy","variant":"no tools","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"Humanity's Last Exam","score":46.8,"metric":"accuracy","variant":"with tools","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"},{"name":"OSWorld-Verified","score":78.5,"metric":"success rate","source":"https://www.anthropic.com/news/claude-sonnet-5","date":"2026-06-30"}]},"tencent/hy3-preview":{"id":"tencent/hy3-preview","name":"Hy3 preview","description":"Tencent Hy reasoning model for coding, instruction following, and agent tasks","family":"Hy","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-04-20","last_updated":"2026-04-20","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":64000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/tencent/Hy3-preview"}],"benchmarks":[{"name":"SWE-Bench Verified","score":74.4,"metric":"resolved","source":"https://huggingface.co/tencent/Hy3-preview"}]},"cohere/command-a-03-2025":{"id":"cohere/command-a-03-2025","name":"Command A","description":"Cohere command model for multilingual enterprise agents, tools, and chat","family":"command-a","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-06-01","release_date":"2025-03-13","last_updated":"2025-03-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":8000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/CohereLabs/c4ai-command-a-03-2025"}],"benchmarks":[{"name":"Aider Polyglot","score":12,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-03-14"}]},"cohere/command-r-08-2024":{"id":"cohere/command-r-08-2024","name":"Command R","description":"Cohere retrieval model for long-context chat and enterprise RAG workflows","family":"command-r","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-06-01","release_date":"2024-08-30","last_updated":"2024-08-30","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/CohereLabs/c4ai-command-r-08-2024"}]},"cohere/command-r7b-12-2024":{"id":"cohere/command-r7b-12-2024","name":"Command R7B","description":"Cohere retrieval model for long-context chat and enterprise RAG workflows","family":"command-r","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-06-01","release_date":"2024-12-02","last_updated":"2024-12-02","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/CohereLabs/c4ai-command-r7b-12-2024"}]},"cohere/command-a-plus-05-2026":{"id":"cohere/command-a-plus-05-2026","name":"Command A Plus","description":"Cohere's stronger command model for multilingual agents and enterprise workflows","family":"command-a","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-04-01","release_date":"2026-05-20","last_updated":"2026-06-09","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":64000}},"cohere/command-r-plus-08-2024":{"id":"cohere/command-r-plus-08-2024","name":"Command R+","description":"Cohere's RAG workhorse for long-context enterprise search and tool use","family":"command-r","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-06-01","release_date":"2024-08-30","last_updated":"2024-08-30","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/CohereLabs/c4ai-command-r-plus-08-2024"}]},"cohere/north-mini-code-1-0":{"id":"cohere/north-mini-code-1-0","name":"North Mini Code","description":"Cohere coding model for practical software engineering and agentic edits","family":"north","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-09-23","release_date":"2026-06-09","last_updated":"2026-06-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"output":64000},"benchmarks":[{"name":"SWE-Bench Verified","score":67.6,"metric":"resolved","harness":"SWE-agent","source":"https://huggingface.co/CohereLabs/North-Mini-Code-1.0","date":"2026-06-09"},{"name":"SWE-Bench Pro","score":40.2,"metric":"resolve rate","harness":"SWE-agent","source":"https://huggingface.co/CohereLabs/North-Mini-Code-1.0","date":"2026-06-09"},{"name":"Artificial Analysis Intelligence Index","score":27.6,"metric":"index score","source":"https://artificialanalysis.ai/articles/north-mini-code-cohere-s-small-coding-focused-moe-model","date":"2026-06-09"},{"name":"Artificial Analysis Coding Index","score":33.4,"metric":"index score","source":"https://artificialanalysis.ai/articles/north-mini-code-cohere-s-small-coding-focused-moe-model","date":"2026-06-09"},{"name":"GDPval-AA","score":14,"metric":"win rate","source":"https://artificialanalysis.ai/articles/north-mini-code-cohere-s-small-coding-focused-moe-model","date":"2026-06-09"},{"name":"τ²-Bench Telecom","score":37,"metric":"success rate","source":"https://artificialanalysis.ai/articles/north-mini-code-cohere-s-small-coding-focused-moe-model","date":"2026-06-09"}]},"sarvam/sarvam-105b":{"id":"sarvam/sarvam-105b","name":"Sarvam 105B","description":"Flagship Indian-language reasoning model for enterprise multilingual applications","family":"sarvam","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-09-01","last_updated":"2025-09-01","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":131072}},"sarvam/sarvam-30b":{"id":"sarvam/sarvam-30b","name":"Sarvam 30B","description":"Efficient Indian-language reasoning model for chat, coding, and multilingual work","family":"sarvam","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-02-18","last_updated":"2026-02-18","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":128000}},"stepfun/step-3.7-flash":{"id":"stepfun/step-3.7-flash","name":"Step 3.7 Flash","description":"Newer StepFun flash model for faster agents, coding, and multimodal prompts","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2026-03-01","release_date":"2026-05-29","last_updated":"2026-05-29","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"input":256000,"output":256000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/stepfun-ai/Step-3.7-Flash"}],"benchmarks":[{"name":"SWE-Bench Pro","score":56.3,"metric":"resolve rate","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"SWE-Bench Verified","score":76.5,"metric":"resolved","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"Terminal-Bench","score":59.6,"metric":"success rate","version":"2.1","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"Humanity's Last Exam","score":47.2,"metric":"accuracy","variant":"with tools","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"BrowseComp","score":75.8,"metric":"accuracy","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"Toolathlon","score":49.5,"metric":"success rate","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"GDPval","score":45.8,"metric":"wins or ties","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"ClawEval","score":67.1,"metric":"pass^3","version":"1.1","source":"https://static.stepfun.com/blog/step-3.7-flash/","date":"2026-05-29"},{"name":"Artificial Analysis Coding Index","score":37.1,"metric":"index","source":"https://openrouter.ai/stepfun/step-3.7-flash/benchmarks","date":"2026-06-15"},{"name":"SciCode","score":40,"metric":"percent correct","source":"https://openrouter.ai/stepfun/step-3.7-flash/benchmarks","date":"2026-06-15"},{"name":"Terminal-Bench Hard","score":35.6,"metric":"success rate","source":"https://openrouter.ai/stepfun/step-3.7-flash/benchmarks","date":"2026-06-15"}]},"stepfun/step-3.5-flash-2603":{"id":"stepfun/step-3.5-flash-2603","name":"Step 3.5 Flash 2603","description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"input":256000,"output":256000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/stepfun-ai/Step-3.5-Flash"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":34.6,"metric":"index","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"},{"name":"SciCode","score":38.5,"metric":"percent correct","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"},{"name":"Terminal-Bench Hard","score":32.6,"metric":"success rate","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"}]},"stepfun/step-3.5-flash":{"id":"stepfun/step-3.5-flash","name":"Step 3.5 Flash","description":"StepFun flash lane for quick multimodal reasoning and coding assistance","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-01","release_date":"2026-01-29","last_updated":"2026-02-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":256000,"input":256000,"output":256000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/stepfun-ai/Step-3.5-Flash"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":31.6,"metric":"index","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"},{"name":"SciCode","score":40.4,"metric":"percent correct","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"},{"name":"Terminal-Bench Hard","score":27.3,"metric":"success rate","source":"https://openrouter.ai/stepfun/step-3.5-flash/benchmarks","date":"2026-06-02"},{"name":"SWE-Bench Verified","score":74.4,"metric":"resolved","source":"https://arxiv.org/abs/2602.10604"}]},"perplexity/sonar-reasoning-pro":{"id":"perplexity/sonar-reasoning-pro","name":"Sonar Reasoning Pro","description":"Web-grounded Sonar for multi-step research questions that need cited reasoning","family":"sonar-reasoning","attachment":true,"reasoning":true,"tool_call":false,"temperature":true,"knowledge":"2025-09-01","release_date":"2024-01-01","last_updated":"2025-09-01","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":4096}},"perplexity/sonar":{"id":"perplexity/sonar","name":"Sonar","description":"Fast web-grounded Sonar for current answers, citations, and lightweight retrieval","family":"sonar","attachment":false,"reasoning":false,"tool_call":false,"temperature":true,"knowledge":"2025-09-01","release_date":"2024-01-01","last_updated":"2025-09-01","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":128000,"output":4096},"benchmarks":[{"name":"SciCode","score":22.9,"metric":"percent correct","source":"https://openrouter.ai/perplexity/sonar/benchmarks","date":"2026-03-11"}]},"perplexity/sonar-pro":{"id":"perplexity/sonar-pro","name":"Sonar Pro","description":"Deeper Sonar search model with broader retrieval and stronger synthesis","family":"sonar-pro","attachment":true,"reasoning":false,"tool_call":false,"temperature":true,"knowledge":"2025-09-01","release_date":"2024-01-01","last_updated":"2025-09-01","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":200000,"output":8192},"benchmarks":[{"name":"SciCode","score":22.6,"metric":"percent correct","source":"https://openrouter.ai/perplexity/sonar-pro/benchmarks","date":"2026-03-11"}]},"alibaba/qwen3-coder-plus":{"id":"alibaba/qwen3-coder-plus","name":"Qwen3 Coder Plus","description":"Hosted Qwen coder for software agents, repo edits, and long-context code","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-07-23","last_updated":"2025-07-23","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1048576,"output":65536}},"alibaba/qwen-plus":{"id":"alibaba/qwen-plus","name":"Qwen Plus","description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-01-25","last_updated":"2025-09-11","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":32768}},"alibaba/qwen3-coder-30b-a3b-instruct":{"id":"alibaba/qwen3-coder-30b-a3b-instruct","name":"Qwen3-Coder 30B-A3B Instruct","description":"Smaller Qwen coder for efficient local agents and repo-level fixes","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-04","last_updated":"2025-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-Coder-30B-A3B-Instruct"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":19.4,"metric":"index","source":"https://openrouter.ai/qwen/qwen3-coder-30b-a3b-instruct/benchmarks","date":"2026-06-02"},{"name":"SciCode","score":27.8,"metric":"percent correct","source":"https://openrouter.ai/qwen/qwen3-coder-30b-a3b-instruct/benchmarks","date":"2026-06-02"},{"name":"Terminal-Bench Hard","score":15.2,"metric":"success rate","source":"https://openrouter.ai/qwen/qwen3-coder-30b-a3b-instruct/benchmarks","date":"2026-06-02"}]},"alibaba/qwen3-32b":{"id":"alibaba/qwen3-32b","name":"Qwen3 32B","description":"Dense open Qwen model for self-hosted chat, reasoning, and coding","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-04","last_updated":"2025-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-32B"}],"benchmarks":[{"name":"Aider Polyglot","score":40,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-08"}]},"alibaba/qwen3-next-80b-a3b-instruct":{"id":"alibaba/qwen3-next-80b-a3b-instruct","name":"Qwen3-Next 80B-A3B Instruct","description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-09","last_updated":"2025-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Instruct"}]},"alibaba/qwen3.7-plus":{"id":"alibaba/qwen3.7-plus","name":"Qwen3.7 Plus","description":"Multimodal Qwen workhorse for long-context agents, visual inputs, and coding","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-06-02","last_updated":"2026-06-02","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":64000}},"alibaba/qwen3.6-35b-a3b":{"id":"alibaba/qwen3.6-35b-a3b","name":"Qwen3.6 35B-A3B","description":"Open multimodal Qwen MoE for local agents that need vision, audio, and code","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-17","last_updated":"2026-04-17","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":73.4,"metric":"resolved","source":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B"}]},"alibaba/qwen3.7-max":{"id":"alibaba/qwen3.7-max","name":"Qwen3.7 Max","description":"Qwen frontier model tuned for agent frameworks, coding assistants, and long tasks","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-05-21","last_updated":"2026-05-21","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":65536},"benchmarks":[{"name":"SWE-Bench Verified","score":80.4,"metric":"resolved","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"SWE-Bench Pro","score":60.6,"metric":"resolve rate","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"SWE-Bench Multilingual","score":78.3,"metric":"resolve rate","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"Terminal-Bench","score":69.7,"metric":"success rate","harness":"Terminus-2","version":"2.0","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"GPQA Diamond","score":92.4,"metric":"accuracy","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"Humanity's Last Exam","score":41.4,"metric":"accuracy","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"SciCode","score":53.5,"source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"MCP Atlas","score":76.4,"metric":"success rate","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"},{"name":"NL2Repo","score":47.2,"harness":"Claude Code","source":"https://qwen.ai/blog?id=qwen3.7","date":"2026-05-19"}]},"alibaba/qwen3-max":{"id":"alibaba/qwen3-max","name":"Qwen3 Max","description":"Flagship Qwen3 model for coding agents, complex reasoning, and tool use","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-09-23","last_updated":"2025-09-23","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":262144,"output":65536},"benchmarks":[{"name":"Artificial Analysis Coding Index","score":26.4,"metric":"index","source":"https://openrouter.ai/qwen/qwen3-max/benchmarks","date":"2026-05-30"},{"name":"SciCode","score":38.3,"metric":"percent correct","source":"https://openrouter.ai/qwen/qwen3-max/benchmarks","date":"2026-05-30"},{"name":"Terminal-Bench Hard","score":20.5,"metric":"success rate","source":"https://openrouter.ai/qwen/qwen3-max/benchmarks","date":"2026-05-30"}]},"alibaba/qwen3-next-80b-a3b-thinking":{"id":"alibaba/qwen3-next-80b-a3b-thinking","name":"Qwen3-Next 80B-A3B (Thinking)","description":"Efficient Qwen thinking model for local reasoning, math, and coding agents","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-09","last_updated":"2025-09","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Thinking"}]},"alibaba/qwen3.6-flash":{"id":"alibaba/qwen3.6-flash","name":"Qwen3.6 Flash","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen3.6","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-27","last_updated":"2026-04-27","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":65536}},"alibaba/qwen2-5-vl-72b-instruct":{"id":"alibaba/qwen2-5-vl-72b-instruct","name":"Qwen2.5-VL 72B Instruct","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-09","last_updated":"2024-09","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":8192},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen2.5-VL-72B-Instruct"}]},"alibaba/qwen3-vl-plus":{"id":"alibaba/qwen3-vl-plus","name":"Qwen3-VL Plus","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-09-23","last_updated":"2025-09-23","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":262144,"output":32768}},"alibaba/qwen3.5-plus":{"id":"alibaba/qwen3.5-plus","name":"Qwen3.5 Plus","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-02-16","last_updated":"2026-02-16","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":65536}},"alibaba/qwen-omni-turbo":{"id":"alibaba/qwen-omni-turbo","name":"Qwen-Omni Turbo","description":"Qwen omni model for text, vision, audio, and multimodal agent tasks","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-01-19","last_updated":"2025-03-26","modalities":{"input":["text","image","audio","video"],"output":["text","audio"]},"open_weights":false,"limit":{"context":32768,"output":2048}},"alibaba/qwen-flash":{"id":"alibaba/qwen-flash","name":"Qwen Flash","description":"Efficient Qwen model for fast chat, extraction, and high-volume workloads","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-07-28","last_updated":"2025-07-28","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":32768}},"alibaba/qwen-vl-max":{"id":"alibaba/qwen-vl-max","name":"Qwen-VL Max","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-04-08","last_updated":"2025-08-13","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":131072,"output":8192}},"alibaba/qwen3.5-27b":{"id":"alibaba/qwen3.5-27b","name":"Qwen3.5 27B","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-02-23","last_updated":"2026-02-23","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.5-27B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":72.4,"metric":"resolved","source":"https://huggingface.co/Qwen/Qwen3.5-27B"}]},"alibaba/qwen-max":{"id":"alibaba/qwen-max","name":"Qwen Max","description":"Flagship Qwen model for complex reasoning, coding, and agentic workflows","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-04-03","last_updated":"2025-01-25","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":32768,"output":8192},"benchmarks":[{"name":"Aider Polyglot","score":21.8,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-01-28"}]},"alibaba/qwen3-235b-a22b":{"id":"alibaba/qwen3-235b-a22b","name":"Qwen3 235B-A22B","description":"Large open Qwen MoE for multilingual reasoning, coding, and tool use","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-04","last_updated":"2025-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":131072,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-235B-A22B"}],"benchmarks":[{"name":"Aider Polyglot","score":59.6,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-05-09"},{"name":"SWE-Bench Pro","score":21.41,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"alibaba/qwen3.6-27b":{"id":"alibaba/qwen3.6-27b","name":"Qwen3.6 27B","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-22","last_updated":"2026-04-22","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.6-27B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":77.2,"metric":"resolved","source":"https://huggingface.co/Qwen/Qwen3.6-27B"}]},"alibaba/qwen3.5-35b-a3b":{"id":"alibaba/qwen3.5-35b-a3b","name":"Qwen3.5 35B-A3B","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-02-23","last_updated":"2026-02-23","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.5-35B-A3B"}]},"alibaba/qwen3-coder-480b-a35b-instruct":{"id":"alibaba/qwen3-coder-480b-a35b-instruct","name":"Qwen3-Coder 480B-A35B Instruct","description":"Open Qwen coding heavyweight for repository reasoning and agentic engineering","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-04","last_updated":"2025-04","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3-Coder-480B-A35B-Instruct"}],"benchmarks":[{"name":"SWE-Bench Pro","score":38.7,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"alibaba/qwen3.5-9b":{"id":"alibaba/qwen3.5-9b","name":"Qwen3.5 9B","description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-02-23","last_updated":"2026-02-23","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.5-9B"}]},"alibaba/qwq-plus":{"id":"alibaba/qwq-plus","name":"QwQ Plus","description":"Qwen reasoning model for deliberate problem solving, math, and coding","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2025-03-05","last_updated":"2025-03-05","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":131072,"output":8192}},"alibaba/qwen3.5-397b-a17b":{"id":"alibaba/qwen3.5-397b-a17b","name":"Qwen3.5 397B-A17B","description":"Large open Qwen multimodal MoE for visual agents and long technical tasks","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-02-15","last_updated":"2026-02-15","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.5-397B-A17B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":76.4,"metric":"resolved","source":"https://huggingface.co/Qwen/Qwen3.5-397B-A17B"}]},"alibaba/qwen3-coder-flash":{"id":"alibaba/qwen3-coder-flash","name":"Qwen3 Coder Flash","description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2025-07-28","last_updated":"2025-07-28","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":65536}},"alibaba/qwen-turbo":{"id":"alibaba/qwen-turbo","name":"Qwen Turbo","description":"Efficient Qwen model for fast chat, extraction, and high-volume workloads","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-11-01","last_updated":"2025-04-28","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":16384}},"alibaba/qwen3.6-max-preview":{"id":"alibaba/qwen3.6-max-preview","name":"Qwen3.6 Max Preview","description":"Flagship Qwen model for complex reasoning, coding, and agentic workflows","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-04-20","last_updated":"2026-04-20","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":262144,"output":65536}},"alibaba/qwen3.5-122b-a10b":{"id":"alibaba/qwen3.5-122b-a10b","name":"Qwen3.5 122B-A10B","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-02-23","last_updated":"2026-02-23","modalities":{"input":["text","image","video","audio"],"output":["text"]},"open_weights":true,"limit":{"context":262144,"output":65536},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/Qwen/Qwen3.5-122B-A10B"}],"benchmarks":[{"name":"SWE-Bench Verified","score":72,"metric":"resolved","source":"https://huggingface.co/Qwen/Qwen3.5-122B-A10B"}]},"alibaba/qwen-vl-plus":{"id":"alibaba/qwen-vl-plus","name":"Qwen-VL Plus","description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","attachment":false,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-04","release_date":"2024-01-25","last_updated":"2025-08-15","modalities":{"input":["text","image"],"output":["text"]},"open_weights":false,"limit":{"context":131072,"output":8192}},"alibaba/qwen3.6-plus":{"id":"alibaba/qwen3.6-plus","name":"Qwen3.6 Plus","description":"Earlier Qwen multimodal workhorse for million-token agent and document tasks","family":"qwen","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-04","release_date":"2026-04-02","last_updated":"2026-04-02","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":65536}},"meituan/longcat-2.0":{"id":"meituan/longcat-2.0","name":"LongCat-2.0","description":"Meituan LongCat-2.0, a reasoning model with tool calling and a 1M-token context window","family":"longcat","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-30","last_updated":"2026-06-30","modalities":{"input":["text"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":131072},"benchmarks":[{"name":"SWE-Bench Pro","score":59.5,"metric":"resolve rate","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"SWE-Bench Multilingual","score":77.3,"metric":"resolve rate","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"Terminal-Bench","score":70.8,"metric":"success rate","version":"2.1","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"GPQA Diamond","score":88.9,"metric":"accuracy","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"BrowseComp","score":79.9,"metric":"accuracy","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"IFEval","score":90,"metric":"accuracy","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"},{"name":"FORTE","score":73.2,"metric":"success rate","source":"https://github.com/meituan-longcat/longcat-2.0","date":"2026-06-30"}]},"meta/muse-spark-1.1":{"id":"meta/muse-spark-1.1","name":"Muse Spark 1.1","description":"Muse Spark is a natively multimodal reasoning model with support for tool-use, visual chain of thought, and multi-agent orchestration.","family":"muse","attachment":true,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"release_date":"2026-04-08","last_updated":"2026-07-09","modalities":{"input":["text","image","pdf","video"],"output":["text"]},"open_weights":false,"limit":{"context":1000000,"output":32000},"benchmarks":[{"name":"SWE-Bench Pro","score":61.5,"metric":"resolve rate","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"Terminal-Bench","score":80,"metric":"success rate","version":"2.1","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"DeepSWE","score":53.3,"metric":"resolve rate","version":"1.1","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"MCP Atlas","score":88.1,"metric":"success rate","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"JobBench","score":54.7,"metric":"success rate","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"Toolathlon-Verified","score":75.6,"metric":"success rate","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"Humanity's Last Exam","score":62.1,"metric":"accuracy","variant":"with tools","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"OSWorld-Verified","score":80.8,"metric":"success rate","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"Finance Agent","score":57.2,"metric":"accuracy","version":"v2","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"CharXiv Reasoning","score":88.4,"metric":"accuracy","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"},{"name":"BabyVision","score":76.3,"metric":"accuracy","source":"https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/","date":"2026-07-09"}]},"meta/llama-4-scout-17b-instruct":{"id":"meta/llama-4-scout-17b-instruct","name":"Llama 4 Scout 17B Instruct","description":"Open Llama with long-context vision for efficient multimodal agents","family":"llama","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-08","release_date":"2025-04-05","last_updated":"2025-04-05","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":3500000,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct"}]},"meta/llama-3.3-70b-instruct":{"id":"meta/llama-3.3-70b-instruct","name":"Llama-3.3-70B-Instruct","description":"Popular open Llama workhorse for multilingual chat, coding, and self-hosting","family":"llama","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2023-12","release_date":"2024-12-06","last_updated":"2024-12-06","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":4096},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct"}],"benchmarks":[{"name":"Artificial Analysis Coding Index","score":10.7,"metric":"index","source":"https://openrouter.ai/meta-llama/llama-3.3-70b-instruct/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":26,"metric":"percent correct","source":"https://openrouter.ai/meta-llama/llama-3.3-70b-instruct/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":3,"metric":"success rate","source":"https://openrouter.ai/meta-llama/llama-3.3-70b-instruct/benchmarks","date":"2026-03-11"}]},"meta/llama-4-maverick-17b-instruct":{"id":"meta/llama-4-maverick-17b-instruct","name":"Llama 4 Maverick 17B Instruct","description":"Open multimodal Llama for strong reasoning with efficient everyday serving","family":"llama","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2024-08","release_date":"2025-04-05","last_updated":"2025-04-05","modalities":{"input":["text","image"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":16384},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Instruct"}],"benchmarks":[{"name":"Aider Polyglot","score":15.6,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-04-06"},{"name":"SWE-Bench Pro","score":5.24,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"deepseek/deepseek-v4-flash":{"id":"deepseek/deepseek-v4-flash","name":"DeepSeek V4 Flash","description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-05","release_date":"2026-04-24","last_updated":"2026-04-24","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":384000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash"}],"benchmarks":[{"name":"SWE-Bench Verified","score":79,"metric":"resolved","source":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash"}]},"deepseek/deepseek-v4-pro":{"id":"deepseek/deepseek-v4-pro","name":"DeepSeek V4 Pro","description":"Open MoE flagship with million-token context for coding and long agent runs","family":"deepseek-thinking","attachment":false,"reasoning":true,"tool_call":true,"structured_output":true,"temperature":true,"knowledge":"2025-05","release_date":"2026-04-24","last_updated":"2026-04-24","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":384000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro"}],"benchmarks":[{"name":"SWE-Bench Verified","score":80.6,"metric":"resolved","source":"https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro"},{"name":"Artificial Analysis Coding Agent Index","score":50.1,"metric":"average pass@1","harness":"Claude Code","variant":"high","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Atlas Codebase QnA","score":67.8,"metric":"pass@1","harness":"Claude Code","variant":"high","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"SWE-Bench Pro","score":18,"metric":"pass@1","harness":"Claude Code","variant":"high","dataset":"hard-aa","source":"https://artificialanalysis.ai/agents/coding-agents"},{"name":"Terminal-Bench","score":64.7,"metric":"pass@1","harness":"Claude Code","variant":"high","version":"2.1","source":"https://artificialanalysis.ai/agents/coding-agents"}]},"deepseek/deepseek-r1":{"id":"deepseek/deepseek-r1","name":"DeepSeek-R1","description":"Classic open reasoning model for transparent math, coding, and deliberate problem solving","family":"deepseek-thinking","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2024-07","release_date":"2025-01-20","last_updated":"2025-05-29","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":128000,"output":32768},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepseek-ai/DeepSeek-R1"}],"benchmarks":[{"name":"Aider Polyglot","score":56.9,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-01-20"},{"name":"Artificial Analysis Coding Index","score":15.9,"metric":"index","source":"https://openrouter.ai/deepseek/deepseek-r1/benchmarks","date":"2026-03-11"},{"name":"SciCode","score":35.7,"metric":"percent correct","source":"https://openrouter.ai/deepseek/deepseek-r1/benchmarks","date":"2026-03-11"},{"name":"Terminal-Bench Hard","score":6.1,"metric":"success rate","source":"https://openrouter.ai/deepseek/deepseek-r1/benchmarks","date":"2026-03-11"}]},"deepseek/deepseek-reasoner":{"id":"deepseek/deepseek-reasoner","name":"DeepSeek Reasoner","description":"DeepSeek reasoning model for multi-step analysis, math, coding, and tools","family":"deepseek-thinking","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"knowledge":"2025-09","release_date":"2025-12-01","last_updated":"2026-02-28","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":384000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepseek-ai/DeepSeek-V3.2"}],"benchmarks":[{"name":"Aider Polyglot","score":74.2,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-10-03"}]},"deepseek/deepseek-chat":{"id":"deepseek/deepseek-chat","name":"DeepSeek Chat","description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","attachment":true,"reasoning":false,"tool_call":true,"temperature":true,"knowledge":"2025-09","release_date":"2025-12-01","last_updated":"2026-02-28","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":1000000,"output":384000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/deepseek-ai/DeepSeek-V3.2"}],"benchmarks":[{"name":"Aider Polyglot","score":70.2,"metric":"percent correct","source":"https://aider.chat/docs/leaderboards/","date":"2025-10-03"}]},"minimax/MiniMax-M2.1":{"id":"minimax/MiniMax-M2.1","name":"MiniMax-M2.1","description":"Earlier MiniMax agent model for practical coding and productivity tasks","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-12-23","last_updated":"2025-12-23","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2.1"}],"benchmarks":[{"name":"SWE-Bench Verified","score":74,"metric":"resolved","source":"https://huggingface.co/MiniMaxAI/MiniMax-M2.1"},{"name":"SWE-Bench Pro","score":36.81,"metric":"resolve rate","dataset":"public","source":"https://labs.scale.com/leaderboard/swe_bench_pro_public"}]},"minimax/MiniMax-M2.5-highspeed":{"id":"minimax/MiniMax-M2.5-highspeed","name":"MiniMax-M2.5-highspeed","description":"High-speed MiniMax model for low-latency coding and agent workflows","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-02-13","last_updated":"2026-02-13","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2.5"}]},"minimax/MiniMax-M2.7-highspeed":{"id":"minimax/MiniMax-M2.7-highspeed","name":"MiniMax-M2.7-highspeed","description":"Low-latency M2.7 variant for interactive coding plans and agent loops","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-03-18","last_updated":"2026-03-18","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2.7"}]},"minimax/MiniMax-M2":{"id":"minimax/MiniMax-M2","name":"MiniMax-M2","description":"Efficient open MiniMax model built for coding agents and tool-heavy workflows","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2025-10-27","last_updated":"2025-10-27","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":196608,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2"}],"benchmarks":[{"name":"SWE-Bench Verified","score":69.4,"metric":"resolved","source":"https://huggingface.co/MiniMaxAI/MiniMax-M2"}]},"minimax/MiniMax-M2.5":{"id":"minimax/MiniMax-M2.5","name":"MiniMax-M2.5","description":"Prior MiniMax coding model for agent workflows, office edits, and automation","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-02-12","last_updated":"2026-02-12","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2.5"}],"benchmarks":[{"name":"SWE-Bench Verified","score":75.8,"metric":"resolved","source":"https://www.swebench.com/"},{"name":"SWE-Atlas Codebase QnA","score":10.3,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-qna"},{"name":"SWE-Atlas Refactoring","score":19.52,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-refactoring"},{"name":"SWE-Atlas Test Writing","score":18.6,"metric":"score","harness":"Mini-SWE-Agent","source":"https://labs.scale.com/leaderboard/sweatlas-tw"}]},"minimax/MiniMax-M3":{"id":"minimax/MiniMax-M3","name":"MiniMax-M3","description":"MiniMax multimodal model for long-context coding, perception, and agent planning","family":"minimax","attachment":true,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-06-01","last_updated":"2026-06-01","modalities":{"input":["text","image","video"],"output":["text"]},"open_weights":true,"limit":{"context":512000,"output":128000},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M3"}],"benchmarks":[{"name":"SWE-Bench Verified","score":80.5,"metric":"resolved","harness":"Claude Code","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"SWE-Bench Pro","score":59,"metric":"resolve rate","harness":"Claude Code","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"Terminal-Bench","score":66,"metric":"success rate","version":"2.1","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"BrowseComp","score":83.52,"metric":"accuracy","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"MCP Atlas","score":74.2,"metric":"success rate","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"OSWorld-Verified","score":70.06,"metric":"success rate","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"}]},"minimax/MiniMax-M2.7":{"id":"minimax/MiniMax-M2.7","name":"MiniMax-M2.7","description":"Open MiniMax flagship for coding agents, office automation, and complex environments","family":"minimax","attachment":false,"reasoning":true,"tool_call":true,"temperature":true,"release_date":"2026-03-18","last_updated":"2026-03-18","modalities":{"input":["text"],"output":["text"]},"open_weights":true,"limit":{"context":204800,"output":131072},"weights":[{"label":"Hugging Face","url":"https://huggingface.co/MiniMaxAI/MiniMax-M2.7"}],"benchmarks":[{"name":"SWE-Bench Verified","score":79.9,"metric":"resolved","harness":"Claude Code","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"SWE-Bench Pro","score":56.2,"metric":"resolve rate","harness":"Claude Code","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"},{"name":"Terminal-Bench","score":51.1,"metric":"success rate","version":"2.1","source":"https://www.minimax.io/blog/minimax-m3","date":"2026-06-01"}]}}