{"data":[{"created":1785547338,"id":"deepseek/deepseek-v4-flash-0731","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":20000,"price_per_m":20000},"input_cache_read":{"origin_price_per_m":2000,"price_per_m":2000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v4-flash-0731","description":"DeepSeek V4 Flash 0731 是 DeepSeek 推出的一款稀疏混合专家（Mixture-of-Experts, MoE）模型，激活参数为 130 亿，总参数量为 2840 亿。  这个经过重新后训练的版本适用于编程、推理和智能体工作流。","tags":[],"context_size":1048576,"status":1,"display_name":"Deepseek V4 Flash 0731","model_type":"chat","max_output_tokens":393216,"features":["serverless","reasoning","function-calling","structured-outputs"],"endpoints":["chat/completions","anthropic","responses"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1785488171,"id":"moonshotai/kimi-k3-dogfooding","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":200000,"output_token_price_per_m":1000000,"pricing":{"prompt":{"origin_price_per_m":200000,"price_per_m":200000},"completion":{"origin_price_per_m":1000000,"price_per_m":1000000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k3-dogfooding","description":"Kimi K3 是 Kimi 迄今能力最强的模型，拥有 2.8 万亿参数。它基于 Kimi 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，原生支持视觉理解，并拥有 100 万 token 上下文窗口，面向软件工程、知识工作和深度推理等前沿智能场景而设计。","tags":[],"context_size":1048576,"status":1,"display_name":"kimi-k3-dogfooding","model_type":"chat","max_output_tokens":1048576,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1784217407,"id":"moonshotai/kimi-k3","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":200000,"output_token_price_per_m":1000000,"pricing":{"prompt":{"origin_price_per_m":200000,"price_per_m":200000},"completion":{"origin_price_per_m":1000000,"price_per_m":1000000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k3","description":"Kimi K3 是 Kimi 迄今能力最强的模型，拥有 2.8 万亿参数。它基于 Kimi 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，原生支持视觉理解，并拥有 100 万 token 上下文窗口，面向软件工程、知识工作和深度推理等前沿智能场景而设计。","tags":[],"context_size":1048576,"status":1,"display_name":"Kimi K3","model_type":"chat","max_output_tokens":1048576,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1781611668,"id":"zai-org/glm-5.2","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":80000,"output_token_price_per_m":280000,"pricing":{"prompt":{"origin_price_per_m":80000,"price_per_m":80000},"completion":{"origin_price_per_m":280000,"price_per_m":280000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"zai-org/glm-5.2","description":"GLM-5.2 是智谱(Z.AI)最新一代旗舰大模型,面向长程自主任务设计,可在单个任务上持续工作长达 8小时——从初始规划、执行,到迭代优化与生产级成果交付,自主完成端到端工作流。其编码与 agentic 能力比肩国际一线闭源旗舰,在持续执行、复杂工程优化与真实开发场景中表现尤为突出;上下文窗口由上一代的 200K 扩展至 1M。是驱动高级智能体(Agent)与长程编码助手的理想基座模型。","tags":[],"context_size":1048576,"status":1,"display_name":"GLM 5.2","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1781260252,"id":"moonshotai/kimi-k2.7-code","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":65000,"output_token_price_per_m":270000,"pricing":{"prompt":{"origin_price_per_m":65000,"price_per_m":65000},"completion":{"origin_price_per_m":270000,"price_per_m":270000},"input_cache_read":{"origin_price_per_m":13000,"price_per_m":13000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2.7-code","description":"Kimi K2.7 Code 是 MoonshotAI 推出的最强编程与智能体（Agent）模型——采用 1 万亿参数混合专家架构，支持 256K 上下文，并具备交错式思维与多步工具调用能力。它在长周期编程任务上取得了显著提升，同时相比 K2.6 将思考 token 的使用量减少了约 30%，并支持文本、图像和视频输入，可用于视觉驱动的开发工作流。","tags":[],"context_size":262144,"status":1,"display_name":"Kimi K2.7 Code","model_type":"chat","max_output_tokens":262144,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1780282953,"id":"minimax/minimax-m3","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":42000,"output_token_price_per_m":168000,"pricing":{"prompt":{"origin_price_per_m":42000,"price_per_m":42000},"completion":{"origin_price_per_m":168000,"price_per_m":168000},"input_cache_read":{"origin_price_per_m":8400,"price_per_m":8400}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":524288,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":4200,"price_per_m":4200}}},{"min_tokens":524288,"max_tokens":1000000,"pricing":{"prompt":{"origin_price_per_m":42000,"price_per_m":42000},"completion":{"origin_price_per_m":168000,"price_per_m":168000},"input_cache_read":{"origin_price_per_m":8400,"price_per_m":8400}}}],"title":"minimax/minimax-m3","description":"MiniMax-M3 是 MiniMax 推出的一款多模态基础模型。它支持文本、图像和视频输入以及文本输出，具备 100 万 token 的上下文窗口，非常适合长周期的智能体（Agent）任务、编程和工具使用。\n该模型基于 MiniMax 稀疏注意力机制（MSA）构建，通过 KV 块选择替代全注意力机制，从而大幅降低长上下文环境下的单 token 计算量——在处理 100 万 token 时，计算成本仅约为上一代的 1/20。在绝大多数任务中保持模型质量的同时，其预填充（prefill）和解码（decode）速度均得到了显著提升。\n作为一个原生多模态模型，MiniMax-M3 在交错数据上进行了训练，并通过交互式用户模拟器框架针对多轮、生产级协作进行了微调。因此，该模型主要面向持续的多步任务，而非单轮执行。","tags":[],"context_size":1000000,"status":1,"display_name":"MiniMax-M3","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1777000636,"id":"deepseek/deepseek-v4-flash","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":20000,"price_per_m":20000},"input_cache_read":{"origin_price_per_m":2000,"price_per_m":2000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v4-flash","description":"DeepSeek-V4-Flash是DeepSeek打造的兼顾极致响应速度与高性价比的轻量级模型。得益于更精简的模型参数与极低的激活开销，V4-Flash 能够为您提供更加快捷、经济的 API 接口服务。在核心能力方面，V4-Flash 展现出了与 V4-Pro 高度接近的卓越推理水准；尽管在世界知识储备上略微精简，但依然能满足绝大多数应用场景的需求。在智能体（Agent）应用中，V4-Flash 在处理各类常规与基础任务时，表现与 Pro 版本旗鼓相当。作为追求高并发、低延迟与成本控制的理想之选，DeepSeek-V4-Flash 为大规模、高频次的轻量级 AI 任务部署提供了最优解。","tags":[],"context_size":1048576,"status":1,"display_name":"Deepseek V4 Flash","model_type":"chat","max_output_tokens":393216,"features":["serverless","reasoning","function-calling","structured-outputs"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1777000348,"id":"deepseek/deepseek-v4-pro","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":30000,"output_token_price_per_m":60000,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":60000,"price_per_m":60000},"input_cache_read":{"origin_price_per_m":10000,"price_per_m":10000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v4-pro","description":"DeepSeek-V4-Pro是DeepSeek打造的新一代旗舰级开源大模型，其综合效能已全面跃升至比肩世界顶尖闭源模型的水准。相比前代，V4-Pro的智能体（Agent）能力实现了突破性进化，在Agentic Coding领域稳居当前开源阵营榜首，能够提供超越业界主流基准（如 Sonnet 4.5）的高质量端到端代码交付体验。此外，该模型不仅具备领跑开源社区的海量世界知识储备，更在数学、STEM 及竞赛级编程等高难度推理测评中，展现出超越所有已公开开源模型、媲美全球顶级闭源巨头的极致逻辑推理实力。作为构建复杂智能体工作流、专业级代码开发与高阶前沿 AI 应用的理想基座，DeepSeek-V4-Pro 将为企业与开发者提供无与伦比的生产力赋能。","tags":[],"context_size":1048576,"status":1,"display_name":"Deepseek V4 Pro","model_type":"chat","max_output_tokens":393216,"features":["serverless","reasoning","function-calling","structured-outputs"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1785725798,"id":"qwen/qwen3.8-max","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":120000,"output_token_price_per_m":360000,"pricing":{"prompt":{"origin_price_per_m":120000,"price_per_m":120000},"completion":{"origin_price_per_m":360000,"price_per_m":360000},"input_cache_read":{"origin_price_per_m":15000,"price_per_m":15000}},"is_tiered_billing":false,"title":"qwen/qwen3.8-max","description":"2.4万亿参数MoE旗舰，编程与办公能力全面跃升，可自主编程十数天交付完整项目。胜任法律、金融、设计等数百种专业任务，一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程，支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代，持续进化。","tags":[],"context_size":1000000,"status":1,"display_name":"Qwen3.8 Max","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic","responses"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1780038921,"id":"xiaomimimo/mimo-v2.5","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":20000,"price_per_m":20000},"input_cache_read":{"origin_price_per_m":200,"price_per_m":200}},"is_tiered_billing":false,"title":"xiaomimimo/mimo-v2.5","description":"mimo-v2.5， 原生全模态模型，支持文本、图像、视频和音频理解，具备强大的 Agent 能力","tags":[],"context_size":1048576,"status":1,"display_name":"XiaomiMiMo/MiMo-V2.5","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["completions","chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1779367764,"id":"qwen/qwen3.7-max","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":60000,"output_token_price_per_m":180000,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":180000,"price_per_m":180000},"input_cache_read":{"origin_price_per_m":12000,"price_per_m":12000}},"is_tiered_billing":false,"title":"qwen/qwen3.7-max","description":"Qwen3.7系列中规模最大、综合能力最强的Max模型，当前开放纯文本模型能力供体验。Qwen3.7是面向智能体时代的新一代旗舰模型，核心优势在于智能体能力的广度与深度：在编程、办公与生产力、长周期自主执行方面均能出色胜任各项任务。","tags":[],"context_size":1000000,"status":1,"display_name":"Qwen3.7-Max","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1778060201,"id":"xiaomimimo/mimo-v2.5-pro","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":30000,"output_token_price_per_m":60000,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":60000,"price_per_m":60000},"input_cache_read":{"origin_price_per_m":250,"price_per_m":250}},"is_tiered_billing":false,"title":"xiaomimimo/mimo-v2.5-pro","description":"MiMo-V2.5-Pro专为突破复杂软件工程与极致长程任务的边界而生。相较于上一代产品，它在通用智能体能力上实现了全方位跃升，将人机协作范式推向了真正的“自主交付”。它能够在无人工干预的情况下，稳定驾驭单次高达近千轮工具调用的超大跨度工作流，不仅能精准捕捉超长上下文中的隐性要求，更展现出卓越的全局架构规划与自我纠错纪律。在核心的 Agent 场景与长程复杂任务维度上，MiMo-V2.5-Pro 已具备与 Claude Opus 4.6、GPT-5.4 等全球第一梯队模型正面较量的硬核实力。凭借这种极高的执行置信度与长周期逻辑一致性，它已完全能够摆脱“辅助”标签，在真实业务中承担起真正严肃的专业级工作。","tags":[],"context_size":1048576,"status":1,"display_name":"XiaomiMiMo/MiMo-V2.5-Pro","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["completions","chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776936016,"id":"qwen/qwen3.6-27b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":30000,"output_token_price_per_m":180000,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":180000,"price_per_m":180000}},"is_tiered_billing":false,"title":"qwen/qwen3.6-27b","description":"Qwen3.6系列27B原生视觉语言Dense模型，模型效果相较3.5-27B重点提升了Agentic coding能力、模型STEM与推理能力进一步增强；视觉模态方面在空间智能、物体定位与检测能力上显著增强，视频理解、文档OCR及视觉Agent能力稳步提升。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.6-27B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1776650775,"id":"moonshotai/kimi-k2.6","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":65000,"output_token_price_per_m":270000,"pricing":{"prompt":{"origin_price_per_m":65000,"price_per_m":65000},"completion":{"origin_price_per_m":270000,"price_per_m":270000},"input_cache_read":{"origin_price_per_m":11000,"price_per_m":11000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2.6","description":"Kimi K2.6是一款开源的原生多模态智能体大模型，在长周期代码开发、代码驱动设计、主动式自主执行以及智能体集群编排等核心能力上实现了全面跃升。该模型不仅能跨语言、跨领域胜任复杂的端到端开发任务，还能将简单的自然语言与视觉输入直接转化为具备审美精度的生产级界面与全栈工作流。更具突破性的是，K2.6 支持横向扩展至300个子智能体、协同执行高达 4000 步的复杂操作，能够动态拆解任务并一次性完成从文档、报表到网站的端到端交付。同时，凭借强大的主动式编排能力，K2.6能够完美支撑7x24小时全天候无人工干预的后台自主运行，全面接管日程管理、代码执行与跨平台操作，是构建下一代复杂自主智能体系统的理想底座。","tags":[],"context_size":262144,"status":1,"display_name":"Kimi K2.6","model_type":"chat","max_output_tokens":262144,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1775554068,"id":"zai-org/glm-5.1","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":80000,"output_token_price_per_m":280000,"pricing":{"prompt":{"origin_price_per_m":80000,"price_per_m":80000},"completion":{"origin_price_per_m":280000,"price_per_m":280000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":240000,"price_per_m":240000},"input_cache_read":{"origin_price_per_m":13000,"price_per_m":13000}}},{"min_tokens":32768,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":80000,"price_per_m":80000},"completion":{"origin_price_per_m":280000,"price_per_m":280000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}}}],"title":"zai-org/glm-5.1","description":"GLM-5.1 是专为复杂系统工程与长程 Agent 任务设计的开源基座模型，旨在为顶尖程序员提供可靠生产力。区别于仅关注代码片段生成的传统模型，GLM-5.1突破了“能写代码”到“能构建系统”的界限，具备资深架构师级的长程规划与执行能力。它摒弃了“重前端、轻逻辑”的路径，在后端重构、复杂算法实现及深度调试上展现出卓越的推理与自愈能力，能自主分析日志并迭代修复顽固 Bug 直至系统跑通。作为开源界首个具备类 Opus 风格及系统工程能力的模型，GLM-5.1不仅赋予开发者极致的逻辑密度，更提供了本地部署的自由与高性价比，是大型后端开发与自动化 Agent 构建的理想选择。","tags":[],"context_size":204800,"status":1,"display_name":"GLM-5.1","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1775119888,"id":"minimax/minimax-m2.7-highspeed","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":42000,"output_token_price_per_m":168000,"pricing":{"prompt":{"origin_price_per_m":42000,"price_per_m":42000},"completion":{"origin_price_per_m":168000,"price_per_m":168000},"input_cache_read":{"origin_price_per_m":4200,"price_per_m":4200},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2.7-highspeed","description":"MiniMax M2.7-highspeed 是MiniMax M2.7的高速版，完美融合了硬核的工程生产力与高情商的拟人交互能力。在真实的软件工程场景中，M2.7 展现出卓越的极客素养，不仅能独立承担端到端的完整项目交付，还能高效处理日志排查、代码安全及机器学习等高难度任务。在专业办公领域，它凭借开源最高的 GDPval-AA 得分（1495 ELO），实现了对 Office 三件套的高保真复杂编辑与多轮修改，任务交付能力跃升至行业顶尖水平。作为复杂环境交互的利器，M2.7 在处理长上下文及复杂工具调用时保持着高达 97% 的技能遵循率，其在 MMClaw 的评测表现已直逼最新的 Sonnet 4.6。更为难得的是，M2.7 打破了传统生产力模型“冷冰冰”的工具属性，具备极佳的身份保持能力与高情商，在赋能企业级自动化的同时，也为互动娱乐场景的创新释放了巨大的想象空间。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax M2.7-highspeed","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1775117974,"id":"zai-org/glm-5v-turbo","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":70000,"output_token_price_per_m":260000,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":260000,"price_per_m":260000},"input_cache_read":{"origin_price_per_m":18000,"price_per_m":18000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":50000,"price_per_m":50000},"completion":{"origin_price_per_m":220000,"price_per_m":220000},"input_cache_read":{"origin_price_per_m":12000,"price_per_m":12000}}},{"min_tokens":32768,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":260000,"price_per_m":260000},"input_cache_read":{"origin_price_per_m":18000,"price_per_m":18000}}}],"title":"zai-org/glm-5v-turbo","description":"GLM-5V-Turbo 是智谱首个多模态 Coding 基座模型，面向视觉编程任务打造。能够原生处理图片、视频、文本等多模态输入，同时擅长长程规划、复杂编程和动作执行；深度适配 Agent 工作流，能够与 Claude Code、OpenClaw 等 Agent 深度协同，完成”看懂环境→规划动作→执行任务”的完整闭环。","tags":[],"context_size":204800,"status":1,"display_name":"GLM-5V-Turbo","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1774514669,"id":"zai-org/glm-5-turbo","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":70000,"output_token_price_per_m":260000,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":260000,"price_per_m":260000},"input_cache_read":{"origin_price_per_m":18000,"price_per_m":18000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":50000,"price_per_m":50000},"completion":{"origin_price_per_m":220000,"price_per_m":220000},"input_cache_read":{"origin_price_per_m":12000,"price_per_m":12000}}},{"min_tokens":32768,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":260000,"price_per_m":260000},"input_cache_read":{"origin_price_per_m":18000,"price_per_m":18000}}}],"title":"zai-org/glm-5-turbo","description":"GLM-5-Turbo 面向 OpenClaw 龙虾场景深度优化的基座模型。 其从训练阶段就针对龙虾任务的核心需求进行专项优化，增强如工具调用、指令遵循、定时与持续性任务、长链路执行等核心能力，使其在复杂、动态、长链路的任务中也真正具备可执行性。","tags":[],"context_size":202800,"status":1,"display_name":"GLM-5-Turbo","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1773974878,"id":"xiaomimimo/mimo-v2-pro","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":140000,"output_token_price_per_m":420000,"pricing":{"prompt":{"origin_price_per_m":140000,"price_per_m":140000},"completion":{"origin_price_per_m":420000,"price_per_m":420000},"input_cache_read":{"origin_price_per_m":28000,"price_per_m":28000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":210000,"price_per_m":210000},"input_cache_read":{"origin_price_per_m":14000,"price_per_m":14000}}},{"min_tokens":262144,"max_tokens":1048576,"pricing":{"prompt":{"origin_price_per_m":140000,"price_per_m":140000},"completion":{"origin_price_per_m":420000,"price_per_m":420000},"input_cache_read":{"origin_price_per_m":28000,"price_per_m":28000}}}],"title":"xiaomimimo/mimo-v2-pro","description":"Xiaomi MiMo-V2-Pro 是一款专为现实世界中高强度 Agent 工作场景打造的顶尖大语言模型。建立在上一代 Flash 模型的坚实基座之上，通过在更广泛任务中的持续算力扩展，MiMo-V2-Pro 将能力从基础的代码编写跨越至端到端的复杂任务执行。它能够在无人工干预的情况下，自主进行长程规划、编排复杂工作流，并跨越 OpenClaw 等不同的智能体框架精准调用工具以交付最终结果。MiMo-V2-Pro 在 Artificial Analysis 综合智能排行榜上高居全球第八、国内第二，且在通用 Agent 和工具调用等多项核心基准测试中与 GPT5.2、Gemini 3.0 Pro 稳居同一梯队。此外，MiMo-V2-Pro 具有极高的推理与生成效率，因为它采用了优化的 7:1 混合注意力架构和轻量级 MTP 层，在支持 1M 超长上下文的同时，将前沿模型的使用成本大幅降低至同类竞品的五分之一。","tags":[],"context_size":1048576,"status":4,"display_name":"XiaomiMiMo/MiMo-V2-Pro","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["completions","chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1773738976,"id":"minimax/minimax-m2.7","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":21000,"output_token_price_per_m":84000,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":4200,"price_per_m":4200},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2.7","description":"MiniMax M2.7 是一款全方位进化的全能型开源大语言模型，完美融合了硬核的工程生产力与高情商的拟人交互能力。在真实的软件工程场景中，M2.7 展现出卓越的极客素养，不仅能独立承担端到端的完整项目交付，还能高效处理日志排查、代码安全及机器学习等高难度任务。在专业办公领域，它凭借开源最高的 GDPval-AA 得分（1495 ELO），实现了对 Office 三件套的高保真复杂编辑与多轮修改，任务交付能力跃升至行业顶尖水平。作为复杂环境交互的利器，M2.7 在处理长上下文及复杂工具调用时保持着高达 97% 的技能遵循率，其在 MMClaw 的评测表现已直逼最新的 Sonnet 4.6。更为难得的是，M2.7 打破了传统生产力模型“冷冰冰”的工具属性，具备极佳的身份保持能力与高情商，在赋能企业级自动化的同时，也为互动娱乐场景的创新释放了巨大的想象空间。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax M2.7","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1772422837,"id":"minimax/minimax-m2.5-highspeed","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":42000,"output_token_price_per_m":168000,"pricing":{"prompt":{"origin_price_per_m":42000,"price_per_m":42000},"completion":{"origin_price_per_m":168000,"price_per_m":168000},"input_cache_read":{"origin_price_per_m":2100,"price_per_m":2100},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2.5-highspeed","description":"MiniMax M2.5-highspeed 是专为追求极致效率的生产力场景打造的加速版 SOTA 模型。它完美继承了 M2.5 的核心智能与强大的数字化工作能力——包括在 SWE-Bench Verified 斩获 80.2% 的编程实力、流畅操作 Office 全家桶的办公通用性，以及复杂环境下的跨软件协作能力。在保持模型推理精度与逻辑深度完全一致的前提下，Highspeed 版本通过更极致的工程优化提供了超低延迟的推理速度。这意味着您不仅拥有一个能规划、能优化的智能助手，更获得了一个能以近乎实时的速度响应高频调用、瞬间处理复杂文档流的“极速引擎”，特别适合对响应时间敏感的交互式应用与大规模自动化流水线。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax M2.5-highspeed","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1772075632,"id":"qwen/qwen3.5-27b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":18000,"output_token_price_per_m":144000,"pricing":{"prompt":{"origin_price_per_m":18000,"price_per_m":18000},"completion":{"origin_price_per_m":144000,"price_per_m":144000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":6000,"price_per_m":6000},"completion":{"origin_price_per_m":48000,"price_per_m":48000}}},{"min_tokens":128000,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":18000,"price_per_m":18000},"completion":{"origin_price_per_m":144000,"price_per_m":144000}}}],"title":"qwen/qwen3.5-27b","description":"Qwen3.5系列27B原生视觉语言Dense模型，融合了线性注意力机制；响应速度快，兼具推理速度和性能。该模型的综合能力接近于Qwen3.5-122B-A10B。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.5-27B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1772074124,"id":"qwen/qwen3.5-122b-a10b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":8000,"price_per_m":8000},"completion":{"origin_price_per_m":64000,"price_per_m":64000}}},{"min_tokens":128000,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}}}],"title":"qwen/qwen3.5-122b-a10b","description":"Qwen3.5系列122B-A10B原生视觉语言模型，基于混合架构设计，融合了线性注意力机制与稀疏混合专家模型，实现了更高的推理效率。该模型的综合表现仅次于Qwen3.5-397B-A17B，文本能力显著优于Qwen3-235B-2507，视觉能力优于Qwen3-VL-235B。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.5-122B-A10B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1772071544,"id":"qwen/qwen3.5-35b-a3b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":16000,"output_token_price_per_m":128000,"pricing":{"prompt":{"origin_price_per_m":16000,"price_per_m":16000},"completion":{"origin_price_per_m":128000,"price_per_m":128000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":4000,"price_per_m":4000},"completion":{"origin_price_per_m":32000,"price_per_m":32000}}},{"min_tokens":128000,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":16000,"price_per_m":16000},"completion":{"origin_price_per_m":128000,"price_per_m":128000}}}],"title":"qwen/qwen3.5-35b-a3b","description":"Qwen3.5系列35B-A3B原生视觉语言模型，基于混合架构设计，融合了线性注意力机制与稀疏混合专家模型，实现了更高的推理效率。该模型的综合表现接近于Qwen3.5-27B。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.5-35B-A3B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1771235830,"id":"qwen/qwen3.5-397b-a17b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":30000,"output_token_price_per_m":180000,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":180000,"price_per_m":180000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":12000,"price_per_m":12000},"completion":{"origin_price_per_m":72000,"price_per_m":72000}}},{"min_tokens":128000,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":180000,"price_per_m":180000}}}],"title":"qwen/qwen3.5-397b-a17b","description":"Qwen3.5系列397B-A17B原生视觉语言模型，基于混合架构设计，融合了线性注意力机制与稀疏混合专家模型，实现了更高的推理效率。在语言理解、逻辑推理、代码生成、智能体任务、图像理解、视频理解、图形用户界面（GUI）等多种任务中，均展现出与当前顶尖前沿模型相媲美的卓越性能。具备强大的代码生成与智能体能力，对于各类智能体场景具有良好的泛化性。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.5-397B-A17B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1771233784,"id":"qwen/qwen3.5-plus","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":240000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":240000,"price_per_m":240000},"input_cache_read":{"origin_price_per_m":4000,"price_per_m":4000},"input_cache_write":{"origin_price_per_m":50000,"price_per_m":50000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":8000,"price_per_m":8000},"completion":{"origin_price_per_m":48000,"price_per_m":48000},"input_cache_read":{"origin_price_per_m":800,"price_per_m":800},"input_cache_write":{"origin_price_per_m":10000,"price_per_m":10000}}},{"min_tokens":128000,"max_tokens":256000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":120000,"price_per_m":120000},"input_cache_read":{"origin_price_per_m":2000,"price_per_m":2000},"input_cache_write":{"origin_price_per_m":25000,"price_per_m":25000}}},{"min_tokens":256000,"max_tokens":1000000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":240000,"price_per_m":240000},"input_cache_read":{"origin_price_per_m":4000,"price_per_m":4000},"input_cache_write":{"origin_price_per_m":50000,"price_per_m":50000}}}],"title":"qwen/qwen3.5-plus","description":"Qwen3.5原生视觉语言系列Plus模型，基于混合架构设计，融合了线性注意力机制与稀疏混合专家模型，实现了更高的推理效率。在多项任务评测中，3.5系列均展现出与当前顶尖前沿模型相媲美的卓越性能，模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步。","tags":[],"context_size":1000000,"status":1,"display_name":"Qwen3.5-Plus","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1770874607,"id":"minimax/minimax-m2.5","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":21000,"output_token_price_per_m":84000,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":2100,"price_per_m":2100},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2.5","description":"MiniMax-M2.5 是一款专为生产力打造的 SOTA大语言模型。经过在各种复杂且真实的数字化工作环境中的训练，M2.5 建立在 M2.1 的编程专长之上，将能力扩展到了通用办公领域。它能够流畅地生成和操作 Word、Excel 和 PowerPoint 文件，在不同的软件环境之间灵活切换，并能跨越不同的人机团队进行协作。M2.5 在 SWE-Bench Verified 上取得了 80.2% 的得分，在 Multi-SWE-Bench 上得分为 51.3%，在 BrowseComp 上得分为 76.3%。此外，M2.5 比上一代产品具有更高的 token 效率，因为它经过专门训练，能够通过规划来优化自身的行动和输出。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax M2.5","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1770628413,"id":"minimax/minimax-m2.1-h","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"minimax/minimax-m2.1-h","description":"MiniMax M2.1模型的发布标志着人工智能辅助开发进入了全新阶段。该模型在多语言编程支持方面取得重大突破，完整覆盖主流开发语言，包括Rust、Java、Golang、C++、Kotlin、Objective-C、TypeScript和JavaScript等，其性能表现位居行业前列。\n\n在技术特性方面，M2.1模型实现了显著的性能优化，响应速度提升22%，同时token消耗降低30%。模型兼容主流智能体框架，包括Claude Code、Droid Factory AI和BlackBox等，支持完整的开发流程协作。\n\n模型功能覆盖移动端开发全场景，支持Android/iOS平台开发需求，具备Web设计理解和3D可视化能力，可生成交互式原型。其代码生成质量经过严格测试，在多个技术赛道展现出色表现。\n\nMiniMax团队通过算法优化和计算架构升级，使M2.1在保持高性能的同时显著降低计算资源消耗，这是人工智能辅助开发工具向产业化应用迈出的重要一步。该模型的推出将重新定义开发者与AI协作的工作模式。","tags":[],"context_size":204800,"status":1,"display_name":"minimax/minimax-m2.1","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1770519812,"id":"zai-org/glm-5","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":60000,"output_token_price_per_m":220000,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":220000,"price_per_m":220000},"input_cache_read":{"origin_price_per_m":15000,"price_per_m":15000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":180000,"price_per_m":180000},"input_cache_read":{"origin_price_per_m":10000,"price_per_m":10000}}},{"min_tokens":32000,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":220000,"price_per_m":220000},"input_cache_read":{"origin_price_per_m":15000,"price_per_m":15000}}}],"title":"zai-org/glm-5","description":"GLM-5 是专为复杂系统工程与长程 Agent 任务设计的开源基座模型，旨在为顶尖程序员提供可靠生产力。区别于仅关注代码片段生成的传统模型，GLM-5 突破了“能写代码”到“能构建系统”的界限，具备资深架构师级的长程规划与执行能力。它摒弃了“重前端、轻逻辑”的路径，在后端重构、复杂算法实现及深度调试上展现出卓越的推理与自愈能力，能自主分析日志并迭代修复顽固 Bug 直至系统跑通。作为开源界首个具备类 Opus 风格及系统工程能力的模型，GLM-5 不仅赋予开发者极致的逻辑密度，更提供了本地部署的自由与高性价比，是大型后端开发与自动化 Agent 构建的理想选择。","tags":[],"context_size":202800,"status":1,"display_name":"GLM-5","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1770139425,"id":"qwen/qwen3-coder-next","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":14000,"output_token_price_per_m":105000,"pricing":{"prompt":{"origin_price_per_m":14000,"price_per_m":14000},"completion":{"origin_price_per_m":105000,"price_per_m":105000}},"is_tiered_billing":false,"title":"qwen/qwen3-coder-next","description":"Qwen3-Coder-Next是一个专门为编码智能体和本地开发环境而设计的开源权重语言模型。这个高效模型仅使用30亿个激活参数（总参数量为800亿），就能实现与激活参数多10-20倍的模型相当的性能，在智能体部署方面保持了卓越的成本效益。通过精密的训练方法，Qwen3-Coder-Next在先进的智能体能力方面表现卓越，包括长程推理、复杂工具使用以及从执行失败中稳健恢复，确保在动态编程任务中的可靠性能。该模型的多功能性通过其25.6万token的上下文长度和对各种脚手架模板的适应性得到进一步增强，能够与多样化的CLI/IDE平台（如Claude Code、Qwen Code、Qoder、Kilo、Trae和Cline）无缝集成，使其成为全面开发环境的理想解决方案。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3 Coder Next","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1769499610,"id":"deepseek/deepseek-ocr-2","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2160,"output_token_price_per_m":2160,"pricing":{"prompt":{"origin_price_per_m":2160,"price_per_m":2160},"completion":{"origin_price_per_m":2160,"price_per_m":2160}},"is_tiered_billing":false,"title":"deepseek/deepseek-ocr-2","description":"DeepSeek-OCR 2 是 DeepSeek AI 发布的多模态文档识别模型，作为 DeepSeek-OCR 的升级版本，通过引入 DeepEncoder V2 架构，实现了视觉编码从「固定扫描」向「语义推理」的范式转变。该模型将原有 CLIP 编码器替换为轻量级语言模型（Qwen2-0.5B），并引入因果流查询机制，解码器沿用 DeepSeek-3B-MoE。模型仅需 256 至 1120 个视觉 Token 即可覆盖复杂文档页面，在 OmniDocBench v1.5 评测中综合得分达 91.09%，较前代提升 3.73%，阅读顺序识别编辑距离从 0.085 降至 0.057。","tags":[],"context_size":8192,"status":1,"display_name":"DeepSeek-OCR 2","model_type":"chat","max_output_tokens":8192,"features":["serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1769495830,"id":"moonshotai/kimi-k2.5","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":210000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":210000,"price_per_m":210000},"input_cache_read":{"origin_price_per_m":7000,"price_per_m":7000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2.5","description":"Kimi K2.5 是 Kimi K2 系列的最新里程碑式升级。它基于 Moonshot AI 的大规模混合专家（MoE）架构，引入了原生多模态处理能力，支持视觉与文本的统一输入及推理。Kimi K2.5 延续了 256k 的超长上下文窗口，并新增了深度思考（Long-Thinking）与快速非思考的双模式支持。此次更新彻底重塑了代码开发体验，特别是在前端领域，实现了从自然语言到复杂动态、交互式 UI 的端到端生成。作为当前最智能的 Kimi 模型，Kimi K2.5 在 Agent 代理、全栈代码开发及视觉理解等通用智能任务上均取得了开源领域的 SOTA 性能，并针对多步逻辑推理和复杂工具调用进行了深度优化。","tags":[],"context_size":262144,"status":1,"display_name":"Kimi K2.5","model_type":"chat","max_output_tokens":262144,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1768823406,"id":"zai-org/glm-4.7-flash","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":5000,"output_token_price_per_m":30000,"pricing":{"prompt":{"origin_price_per_m":5000,"price_per_m":5000},"completion":{"origin_price_per_m":30000,"price_per_m":30000},"input_cache_read":{"origin_price_per_m":1000,"price_per_m":1000}},"is_tiered_billing":false,"title":"zai-org/glm-4.7-flash","description":"GLM-4.7-Flash 作为 30B 级 SOTA 模型，提供了一个兼顾性能与效率的新选择。面向 Agentic Coding 场景强化了编码能力、长程任务规划与工具协同，并在多个公开基准的当期榜单中取得同尺寸开源模型中的领先表现。在执行复杂智能体任务，在工具调用时指令遵循更强，Artifacts 与 Agentic Coding 的前端美感和长程任务完成效率进一步提升。","tags":[],"context_size":200000,"status":1,"display_name":"GLM-4.7-Flash","model_type":"chat","max_output_tokens":128000,"features":["serverless","reasoning","structured-outputs","function-calling"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1766484170,"id":"minimax/minimax-m2.1","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":21000,"output_token_price_per_m":84000,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":2100,"price_per_m":2100},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2.1","description":"MiniMax M2.1模型的发布标志着人工智能辅助开发进入了全新阶段。该模型在多语言编程支持方面取得重大突破，完整覆盖主流开发语言，包括Rust、Java、Golang、C++、Kotlin、Objective-C、TypeScript和JavaScript等，其性能表现位居行业前列。\n\n在技术特性方面，M2.1模型实现了显著的性能优化，响应速度提升22%，同时token消耗降低30%。模型兼容主流智能体框架，包括Claude Code、Droid Factory AI和BlackBox等，支持完整的开发流程协作。\n\n模型功能覆盖移动端开发全场景，支持Android/iOS平台开发需求，具备Web设计理解和3D可视化能力，可生成交互式原型。其代码生成质量经过严格测试，在多个技术赛道展现出色表现。\n\nMiniMax团队通过算法优化和计算架构升级，使M2.1在保持高性能的同时显著降低计算资源消耗，这是人工智能辅助开发工具向产业化应用迈出的重要一步。该模型的推出将重新定义开发者与AI协作的工作模式。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax M2.1","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1766422843,"id":"zai-org/glm-4.7","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000},"input_cache_write":{"origin_price_per_m":8000,"price_per_m":8000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32000,"output_min_tokens":1,"output_max_tokens":200,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000},"input_cache_read":{"origin_price_per_m":4000,"price_per_m":4000}}},{"min_tokens":1,"max_tokens":32000,"output_min_tokens":200,"output_max_tokens":131072,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":140000,"price_per_m":140000},"input_cache_read":{"origin_price_per_m":6000,"price_per_m":6000}}},{"min_tokens":32000,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000}}}],"title":"zai-org/glm-4.7","description":"GLM-4.7是智谱AI最新推出的旗舰大模型，该版本聚焦三大核心升级：1）在复杂智能体任务流中展现出显著的性能提升，支持稳定可靠的多步骤推理与任务执行；2）具备更接近自然人类对话的交互体验，配合增强的前端设计感知能力；3）专为编程场景深度优化，在代码生成、调试及系统级架构设计方面实现技术突破。实际测试表明，该模型能自动处理包含56个关联步骤的CI/CD流水线编排任务，对话中断率较上代降低42%。","tags":[],"context_size":204800,"status":1,"display_name":"GLM-4.7","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1766140448,"id":"xiaomimimo/mimo-v2-flash","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":7000,"output_token_price_per_m":21000,"pricing":{"prompt":{"origin_price_per_m":7000,"price_per_m":7000},"completion":{"origin_price_per_m":21000,"price_per_m":21000},"input_cache_read":{"origin_price_per_m":700,"price_per_m":700}},"is_tiered_billing":false,"title":"xiaomimimo/mimo-v2-flash","description":"Xiaomi MiMo-V2-Flash 是小米专为极致推理效率自研的总参数 309B(激活 15B)的 MoE 模型，通过引入 Hybrid 注意力架构创新 及 多层 MTP 推理加速， 在多个 Agent 测评基准上进入全球开源模型 Top 2;代码能力超过所有开源模型，比肩标杆闭源模型 Claude 4.5 Sonnet，但推理价格仅为其2.5% 且生成速度提升至 2倍，成功将大模型效果和推理效率推向极致。","tags":[],"context_size":262144,"status":4,"display_name":"XiaomiMiMo/MiMo-V2-Flash","model_type":"chat","max_output_tokens":32000,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["completions","chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1765370273,"id":"zai-org/autoglm-phone-9b-multilingual","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2500,"output_token_price_per_m":10000,"pricing":{"prompt":{"origin_price_per_m":2500,"price_per_m":2500},"completion":{"origin_price_per_m":10000,"price_per_m":10000}},"is_tiered_billing":false,"title":"zai-org/autoglm-phone-9b-multilingual","description":"Phone Agent 手机智能助手\n\n基于AutoGLM框架开发，通过多模态感知理解手机屏幕内容，并自动执行操作完成任务。\n\n核心功能\n\n设备控制：通过ADB（安卓调试桥）操控设备\n屏幕理解：视觉语言模型实时解析界面元素\n智能规划：自动生成操作步骤并执行\n使用场景\n\n只需说出需求，例如：\"打开小红书搜索美食推荐\"，系统将自动：\n\n解析意图\n识别当前界面\n规划操作流程\n完成整个任务\n安全机制\n\n敏感操作确认提示\n遇到登录/验证码时自动转人工处理\n支持WiFi/网络远程ADB调试，方便远程控制","tags":[],"context_size":65536,"status":1,"display_name":"AutoGLM-Phone-9B-Multilingual","model_type":"chat","max_output_tokens":32000,"features":["serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1764589183,"id":"deepseek/deepseek-v3.2","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":30000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":30000,"price_per_m":30000},"input_cache_read":{"origin_price_per_m":2000,"price_per_m":2000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3.2","description":"DeepSeek-V3.2 是一款在高效推理、复杂推理能力与智能体场景中表现突出的领先模型。其基于 DeepSeek Sparse Attention（DSA）稀疏注意力机制，在显著降低计算开销的同时优化长上下文性能；通过可扩展强化学习框架，整体能力达到 GPT-5 同级，高算力版本 V3.2-Speciale 更在推理表现上接近 Gemini-3.0-Pro；同时，模型依托大型智能体任务合成管线，具备更强的工具调用与多步骤决策能力，并在 2025 年 IMO 与 IOI 中取得金牌级表现。作为 MaaS 平台，我们已对 DeepSeek-V3.2 完成深度适配，通过动态调度、批处理加速、低延迟推理与企业级 SLA 保障，进一步增强其在企业生产环境中的稳定性、性价比与可控性，适用于搜索、问答、智能体、代码、数据处理等多类高价值场景。","tags":[],"context_size":163840,"status":1,"display_name":"Deepseek V3.2","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1762481395,"id":"moonshotai/kimi-k2-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2-thinking","description":"kimi-k2-thinking 模型是月之暗面提供的具有通用 Agentic 能力和推理能力的思考模型，它擅长深度推理，并可通过多步工具调用，帮助解决各类难题。","tags":[],"context_size":262144,"status":1,"display_name":"Kimi K2 Thinking","model_type":"chat","max_output_tokens":100352,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1761535293,"id":"minimax/minimax-m2","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":21000,"output_token_price_per_m":84000,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":2100,"price_per_m":2100},"input_cache_write":{"origin_price_per_m":26250,"price_per_m":26250}},"is_tiered_billing":false,"title":"minimax/minimax-m2","description":"MiniMax-M2是一款紧凑高效的大型语言模型，专为端到端编程和智能体工作流优化设计，具备100亿激活参数（总参数2300亿），在通用推理、工具使用和多步骤任务执行方面表现接近前沿水平，同时保持低延迟和高部署效率。该模型在代码生成、多文件编辑、编译-运行-修复闭环以及测试验证的缺陷修复方面表现突出，在SWE-Bench Verified、Multi-SWE-Bench和Terminal-Bench等基准测试中成绩优异，同时在BrowseComp和GAIA等智能体评估中展现出长周期任务规划、信息检索和执行错误恢复的竞争力。经Artificial Analysis评测，MiniMax-M2在数学、科学推理和指令遵循等综合智能领域位列开源模型第一梯队，其小激活参数量实现了快速推理、高并发和更优的单位经济效益，非常适合大规模智能体部署、开发者辅助工具以及对响应速度和成本效率有要求的推理驱动型应用。","tags":[],"context_size":204800,"status":1,"display_name":"MiniMax-M2","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1761359410,"id":"deepseek/deepseek-ocr","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2160,"output_token_price_per_m":2160,"pricing":{"prompt":{"origin_price_per_m":2160,"price_per_m":2160},"completion":{"origin_price_per_m":2160,"price_per_m":2160}},"is_tiered_billing":false,"title":"deepseek/deepseek-ocr","description":"DeepSeek-OCR是DeepSeek AI于2025年10月20日发布的多模态模型，旨在探索视觉-文本压缩边界，专注于文档识别及图像转文本场景的解决方案该模型由DeepEncoder编码器与DeepSeek3B-MoE-A570M解码器构成，总参数规模约3B，支持将长文本渲染为高压缩比图像，实现10倍无损压缩时OCR准确率达97%，20倍压缩率下仍保有约60%准确率。","tags":[],"context_size":8192,"status":4,"display_name":"DeepSeek-OCR","model_type":"chat","max_output_tokens":8192,"features":["serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1759142134,"id":"deepseek/deepseek-v3.2-exp","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":30000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":30000,"price_per_m":30000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3.2-exp","description":"DeepSeek-V3.2-Exp是DeepSeek前沿AI模型的实验版本，是迈向下一代架构的关键中间步骤。该创新模型基于经过验证的V3.1-Terminus基础构建，引入了突破性的DeepSeek稀疏注意力（DSA）机制，这是一个精密的稀疏注意力系统，专门设计用于探索和验证在具有挑战性的长上下文场景中增强训练和推理效率的优化方案。DSA技术通过首次实现细粒度稀疏注意力代表了一项重大突破，在保持与之前版本几乎相同的模型输出质量的同时，显著改进了长上下文处理能力。这确保用户在不牺牲准确性或可靠性的前提下获得显著增强的计算效率。跨越多个领域的各种公共基准测试的综合评估证实，DeepSeek-V3.2-Exp展现出与V3.1-Terminus相当的性能，验证了稀疏注意力方法的有效性，并证明了效率提升不会牺牲模型能力。作为一个实验模型，V3.2-Exp既是需要广泛上下文理解的当前应用的强大工具，也是未来创新的重要研究平台，为可扩展注意力机制提供了宝贵见解，这些见解将为下一代AI架构的开发提供指导，并为人工智能系统中的高效长上下文处理建立了新的范式。","tags":[],"context_size":163840,"status":1,"display_name":"Deepseek V3.2 Exp","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1758695290,"id":"qwen/qwen3-omni-30b-a3b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":18000,"output_token_price_per_m":69000,"pricing":{"prompt":{"origin_price_per_m":18000,"price_per_m":18000},"completion":{"origin_price_per_m":69000,"price_per_m":69000},"multimodal_input":[{"modals":["text"],"input_token_base_price":18000,"input_token_discount_price":18000},{"modals":["audio"],"input_token_base_price":158000,"input_token_discount_price":158000},{"modals":["image"],"input_token_base_price":33000,"input_token_discount_price":33000},{"modals":["video"],"input_token_base_price":33000,"input_token_discount_price":33000},{"modals":["image","video"],"input_token_base_price":33000,"input_token_discount_price":33000}],"multimodal_output":[{"modals":["text"],"output_token_base_price":69000,"output_token_discount_price":69000},{"modals":["audio"],"output_token_base_price":626000,"output_token_discount_price":626000}]},"is_tiered_billing":false,"title":"qwen/qwen3-omni-30b-a3b-thinking","description":"Qwen-Omni 模型能够接收文本与单一其他模态（图片、音频、视频）的组合输入，并生成文本或语音形式的回复， 提供多种拟人音色，支持多语言和方言的语音输出，可应用于文本创作、视觉识别、语音助手等场景。","tags":[],"context_size":65536,"status":1,"display_name":"qwen/qwen3-omni-30b-a3b-thinking","model_type":"chat","max_output_tokens":16384,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video","audio"],"output_modalities":["text"]},{"created":1758695265,"id":"qwen/qwen3-vl-235b-a22b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":200000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":200000,"price_per_m":200000}},"is_tiered_billing":false,"title":"qwen/qwen3-vl-235b-a22b-thinking","description":"Qwen3-VL——迄今为止Qwen系列中最强大的视觉-语言模型。\n这一代产品在各个方面都实现了全面升级：卓越的文本理解与生成能力、更深层的视觉感知与推理能力、扩展的上下文长度、增强的空间和视频动态理解能力，以及更强的智能体交互能力。提供Dense和MoE两种架构，可从边缘设备扩展到云端部署，并配备Instruct版本和推理增强的Thinking版本，以实现灵活的按需部署。","tags":[],"context_size":131072,"status":4,"display_name":"Qwen3 VL 235B A22B Thinking","model_type":"chat","max_output_tokens":32768,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1758695250,"id":"qwen/qwen3-vl-235b-a22b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":80000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000}},"is_tiered_billing":false,"title":"qwen/qwen3-vl-235b-a22b-instruct","description":"Qwen3-VL——迄今为止Qwen系列中最强大的视觉-语言模型。\n这一代产品在各个方面都实现了全面升级：卓越的文本理解与生成能力、更深层的视觉感知与推理能力、扩展的上下文长度、增强的空间和视频动态理解能力，以及更强的智能体交互能力。提供Dense和MoE两种架构，可从边缘设备扩展到云端部署，并配备Instruct版本和推理增强的Thinking版本，以实现灵活的按需部署。","tags":[],"context_size":131072,"status":1,"display_name":"Qwen3 VL 235B A22B Instruct","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","video","image"],"output_modalities":["text"]},{"created":1758550342,"id":"deepseek/deepseek-v3.1-terminus","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":120000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":120000,"price_per_m":120000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3.1-terminus","description":"DeepSeek-V3.1-Terminus在保持deepseek v3.1 模型原有全部能力的同时，解决了用户反馈的关键问题，包括：\n- 语言一致性：显著减少中英文混合输出，消除异常字符出现\n- 智能体性能：进一步优化代码智能体和搜索智能体的功能表现","tags":[],"context_size":131072,"status":4,"display_name":"Deepseek V3.1 Terminus","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776757424,"id":"qwen/qwen3.6-35b-a3b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":18000,"output_token_price_per_m":108000,"pricing":{"prompt":{"origin_price_per_m":18000,"price_per_m":18000},"completion":{"origin_price_per_m":108000,"price_per_m":108000}},"is_tiered_billing":false,"title":"qwen/qwen3.6-35b-a3b","description":"Qwen3.6系列35B-A3B原生视觉语言模型，基于混合架构设计，融合了线性注意力机制与稀疏混合专家模型，实现了更高的推理效率。模型效果相较3.5-35B-A3B显著提升了agentic coding能力、数学推理和代码推理能力、空间智能能力、物体定位与目标检测能力。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.6-35B-A3B","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1765205060,"id":"zai-org/glm-4.6v","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":60000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":60000,"price_per_m":60000},"input_cache_read":{"origin_price_per_m":4000,"price_per_m":4000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":30000,"price_per_m":30000}}},{"min_tokens":32768,"max_tokens":131072,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":60000,"price_per_m":60000}}}],"title":"zai-org/glm-4.6v","description":"Zhipu 最新的视觉推理模型，在同等规模下视觉理解准确率达到了 SOTA 水平，原生支持工具调用，能够自动完成任务，支持 128K 超长上下文，并允许灵活开启或关闭思考功能。","tags":[],"context_size":131072,"status":1,"display_name":"GLM 4.6v","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1759220209,"id":"zai-org/glm-4.6","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000},"input_cache_write":{"origin_price_per_m":8000,"price_per_m":8000}},"is_tiered_billing":false,"title":"zai-org/glm-4.6","description":"GLM-4.6 是智谱最新的旗舰模型，其总参数量 355B，激活参数 32B，上下文提升至 200K，8 大权威基准全面提升，稳居国产模型首位。在编程、推理、搜索、写作、智能体应用等核心能力均完成对 GLM-4.5 的超越。\n","tags":[],"context_size":204800,"status":1,"display_name":"GLM 4.6","model_type":"chat","max_output_tokens":131072,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776756905,"id":"qwen/qwen3.6-plus","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":80000,"output_token_price_per_m":480000,"pricing":{"prompt":{"origin_price_per_m":80000,"price_per_m":80000},"completion":{"origin_price_per_m":480000,"price_per_m":480000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000},"input_cache_write":{"origin_price_per_m":100000,"price_per_m":100000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":120000,"price_per_m":120000},"input_cache_read":{"origin_price_per_m":2000,"price_per_m":2000},"input_cache_write":{"origin_price_per_m":25000,"price_per_m":25000}}},{"min_tokens":262144,"max_tokens":1000000,"pricing":{"prompt":{"origin_price_per_m":80000,"price_per_m":80000},"completion":{"origin_price_per_m":480000,"price_per_m":480000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000},"input_cache_write":{"origin_price_per_m":100000,"price_per_m":100000}}}],"title":"qwen/qwen3.6-plus","description":"Qwen3.6原生视觉语言系列Plus模型，展现出与当前顶尖前沿模型相媲美的卓越性能，模型效果相较3.5系列显著提升。模型在Agentic coding、前端编程、Vibe coding等代码能力、多模态万物识别、OCR、物体定位等能力上显著增强。","tags":[],"context_size":1000000,"status":1,"display_name":"Qwen3.6-Plus","model_type":"chat","max_output_tokens":65536,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions","responses"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1759237231,"id":"kat-coder","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":21000,"output_token_price_per_m":84000,"pricing":{"prompt":{"origin_price_per_m":21000,"price_per_m":21000},"completion":{"origin_price_per_m":84000,"price_per_m":84000},"input_cache_read":{"origin_price_per_m":4200,"price_per_m":4200}},"is_tiered_billing":false,"title":"kat-coder","description":"KAT-Coder-Pro V1 是 KwaiKAT 系列中最先进的智能体编程（Agentic Coding）模型。该模型专为 Agentic Coding 设计，全面覆盖真实编程任务与场景，通过大规模智能体强化学习，实现智能行为涌现，在代码编写性能上显著超越同类模型，已通过数千名内部工程师的严格测试。在SWE-Bench Verified 编码能力基准测试中取得了高达 73.4% 的解决率，展现出顶级的编程性能。\n该模型经过了多阶段训练过程的优化，包括中期训练（mid-training）、监督式微调（SFT）、强化微调（RFT）和可扩展的智能体强化学习（scalable agentic RL），使其在工具使用能力、多轮交互、指令遵循、泛化性和综合能力方面都得到了显著提升。","tags":[],"context_size":256000,"status":1,"display_name":"KAT Coder Pro V1","model_type":"chat","max_output_tokens":128000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1742959439,"id":"deepseek/deepseek-v3-0324","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":80000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000},"input_cache_read":{"origin_price_per_m":6000,"price_per_m":6000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3-0324","description":"DeepSeek V3 0324 是深度求索（DeepSeek）团队旗舰级对话模型系列的最新版本，采用混合专家（Mixture-of-Experts, MoE）架构，参数量达685B参数。","tags":[],"context_size":163840,"status":1,"display_name":"DeepSeek V3 0324","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1758682933,"id":"qwen/qwen3-max","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":150000,"output_token_price_per_m":600000,"pricing":{"prompt":{"origin_price_per_m":150000,"price_per_m":150000},"completion":{"origin_price_per_m":600000,"price_per_m":600000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":25000,"price_per_m":25000},"completion":{"origin_price_per_m":100000,"price_per_m":100000}}},{"min_tokens":32768,"max_tokens":131072,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}}},{"min_tokens":131072,"max_tokens":258048,"pricing":{"prompt":{"origin_price_per_m":70000,"price_per_m":70000},"completion":{"origin_price_per_m":280000,"price_per_m":280000}}}],"title":"qwen/qwen3-max","description":"最新Qwen3-Max模型在智能体编程与工具调用方向进行了专项升级。本次发布的正式版模型达到领域SOTA水平，适配场景更加复杂的智能体需求。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3 Max","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1757057023,"id":"moonshotai/kimi-k2-0905","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2-0905","description":"Kimi K2 0905 是 Kimi K2 0711 的九月更新版本。它是由月之暗面（Moonshot AI）开发的大规模专家混合（MoE）语言模型，拥有1万亿总参数，每次前向传播激活320亿参数。该模型支持长上下文推理，最高可达25.6万tokens，相比之前的12.8万tokens有所扩展。\n此次更新改进了智能体编程能力，在各种框架中实现了更高准确性和更好的泛化性能，并增强了前端编程能力，在网页、3D及相关任务中提供更美观和实用的输出。Kimi K2 针对智能体能力进行了优化，包括高级工具使用、推理和代码合成。该模型在编程（LiveCodeBench、SWE-bench）、推理（ZebraLogic、GPQA）和工具使用（Tau2、AceBench）等基准测试中表现优异。该模型采用创新技术栈进行训练，结合了MuonClip优化器，确保大规模MoE训练的稳定性。","tags":[],"context_size":262144,"status":1,"display_name":"Kimi K2 0905","model_type":"chat","max_output_tokens":100352,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1755759184,"id":"deepseek/deepseek-v3.1","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":120000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":120000,"price_per_m":120000},"input_cache_read":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3.1","description":"DeepSeek-V3.1 是 DeepSeek最新的模型，支持思考和非思考混合模式。 该模型是在 DeepSeek-V3.1-Base 基础上进行后期训练的，而该基础模型是通过两阶段长上下文扩展方法从原始 V3 基础检查点发展而来，该方法遵循了原始 DeepSeek-V3 报告中概述的技术路线。我们通过收集更多长文本文档显著扩展了训练数据集，并大幅延长了两个训练阶段的规模：32K 上下文扩展阶段的训练量提升10倍达到6300亿token，128K扩展阶段则扩大3.3倍至2090亿token。","tags":[],"context_size":131072,"status":4,"display_name":"Deepseek V3.1","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1753233447,"id":"qwen/qwen3-coder-480b-a35b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":150000,"output_token_price_per_m":600000,"pricing":{"prompt":{"origin_price_per_m":150000,"price_per_m":150000},"completion":{"origin_price_per_m":600000,"price_per_m":600000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":240000,"price_per_m":240000}}},{"min_tokens":32768,"max_tokens":131072,"pricing":{"prompt":{"origin_price_per_m":90000,"price_per_m":90000},"completion":{"origin_price_per_m":360000,"price_per_m":360000}}},{"min_tokens":131072,"max_tokens":262144,"pricing":{"prompt":{"origin_price_per_m":150000,"price_per_m":150000},"completion":{"origin_price_per_m":600000,"price_per_m":600000}}}],"title":"qwen/qwen3-coder-480b-a35b-instruct","description":"Qwen3-Coder-480B-A35B-Instruct 是由Qwen推出的尖端开源编程模型，在智能体编程（Agentic Coding）、浏览器自动化及核心开发任务中达到与Claude Sonnet同等的性能水平。该模型原生支持256K上下文窗口（通过YaRN技术可扩展至1M token），擅长仓库级代码分析，并针对Qwen Code、CLINE等平台设计了专用函数调用协议——使其成为复杂实际开发工作流的理想选择。","tags":[],"context_size":262144,"status":4,"display_name":"Qwen3 Coder 480B A35B Instruct","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1752263379,"id":"moonshotai/kimi-k2-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"moonshotai/kimi-k2-instruct","description":"Kimi K2 是一种最先进的专家混合 （MoE） 语言模型，具有 320 亿个激活参数和 1 万亿个总参数。使用 Muon 优化器进行训练，Kimi K2 在前沿知识、推理和编码任务方面实现了卓越的性能，同时针对代理功能进行了精心优化，专为工具使用、推理和自主解决问题而设计。","tags":[],"context_size":131072,"status":1,"display_name":"Kimi K2 Instruct","model_type":"chat","max_output_tokens":100352,"features":["function-calling","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1753443179,"id":"qwen/qwen3-235b-a22b-thinking-2507","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":200000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":200000,"price_per_m":200000}},"is_tiered_billing":false,"title":"qwen/qwen3-235b-a22b-thinking-2507","description":"Qwen3-235B-A22B-Thinking-2507是Qwen3系列最新推出的具备思维能力的突破性模型，在推理能力方面实现了跨越式提升。这款先进AI在逻辑推理、数学运算、科学分析、编程任务以及学术基准测试中均展现出显著增强的性能表现，其水平已达到甚至超越人类专家级别，在开源思维模型中树立了全新的性能标杆。除了卓越的推理能力外，该模型在通用能力方面也有显著提升，包括更精准的指令理解与执行、更复杂的工具调用能力、高度拟真的文本生成效果，以及与人类偏好更契合的输出表现。同时，其增强的256K超长上下文理解能力，使其能够精准把握长篇文档和复杂讨论的深层逻辑关联。","tags":[],"context_size":131072,"status":1,"display_name":"Qwen3 235B A22b Thinking 2507","model_type":"chat","max_output_tokens":114688,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1753176332,"id":"qwen/qwen3-235b-a22b-instruct-2507","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":14500,"output_token_price_per_m":58000,"pricing":{"prompt":{"origin_price_per_m":14500,"price_per_m":14500},"completion":{"origin_price_per_m":58000,"price_per_m":58000}},"is_tiered_billing":false,"title":"qwen/qwen3-235b-a22b-instruct-2507","description":"Qwen3-235B-A22B-Instruct-2507 是基于 Qwen3-235B 架构的多语言指令微调混合专家语言模型，每次前向推理激活 220 亿参数。该模型针对通用文本生成任务优化，涵盖指令遵循、逻辑推理、数学计算、代码生成及工具调用等能力。其原生支持 26.2 万 token 的超长上下文窗口，且未采用 \"\u003cthink\u003e\" 思维链显式标注模式。\n相较于基础版本，本版本在知识覆盖广度、长文本推理能力、编程基准测试以及开放性任务对齐度等方面实现显著提升。模型尤其擅长多语言理解、数学推理（如美国数学邀请赛 AIME、哈佛-麻省理工数学锦标赛 HMMT），并在 Arena-Hard 综合评测与写作专项评测 WritingBench 中表现优异。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3 235B A22B Instruct 2507","model_type":"chat","max_output_tokens":260000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1754915492,"id":"zai-org/glm-4.5v","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":120000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":120000,"price_per_m":120000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000}},"is_tiered_billing":false,"title":"zai-org/glm-4.5v","description":"Z.ai推出的GLM-4.5V视觉推理模型树立了行业新标杆，在42项基准测试中均达到同规模开源模型的最高水平。该模型不仅擅长基准测试，更通过混合训练技术在真实场景中展现出卓越性能，具备全方位的视觉理解能力——包括图像/视频分析、图形界面交互、复杂文档处理以及精准的视觉元素定位等核心功能。\n在中国GeoGuessr地理定位挑战赛中，GLM-4.5V仅用16小时就超越了99%的人类选手（共21000人参与），一周内攀升至第66名。该模型基于GLM-4.5-Air基础架构开发，继承了GLM-4.1V-Thinking的技术路线，采用1060亿参数的混合专家（MoE）架构实现高效扩展。作为连接前沿AI研究与实际应用的桥梁，GLM-4.5V正在重新定义视觉智能的行业标准","tags":[],"context_size":65536,"status":1,"display_name":"GLM 4.5V","model_type":"chat","max_output_tokens":16384,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text","video","image"],"output_modalities":["text"]},{"created":1753710159,"id":"zai-org/glm-4.5","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000},"input_cache_read":{"origin_price_per_m":8000,"price_per_m":8000}},"is_tiered_billing":false,"title":"zai-org/glm-4.5","description":"GLM-4.5系列模型是专为智能体（Agent）研发的基座模型。旗舰款GLM-4.5拥有3550亿总参数（320亿激活参数），通过融合推理、编程与智能体能力，满足复杂场景需求。\n作为混合推理系统，它提供双工作模式：\n- 思考模式：支持复杂推理、工具调用和策略规划\n- 即时响应模式：实现低延迟交互，快速生成反馈\n该架构在保持高性能的同时，为动态智能体环境提供自适应解决方案。","tags":[],"context_size":131072,"status":4,"display_name":"GLM-4.5","model_type":"chat","max_output_tokens":98304,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1750139479,"id":"minimaxai/minimax-m1-80k","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"minimaxai/minimax-m1-80k","description":"MiniMax-M1世界上第一个开放权重、大规模混合注意力推理模型。MiniMax-M1 采用混合专家 （MoE） 架构，并结合闪电注意力机制。该模型总共包含 4560 亿个参数，每个令牌激活了 459 亿个参数。M1 模型原生支持 100 万个令牌的上下文长度，是 DeepSeek R1 上下文大小的 8 倍。同时MiniMax-M1  结合 CISPO 算法与混合注意力设计的高效强化学习训练，在长输入推理与真实软件工程场景中实现了业界领先的性能。","tags":[],"context_size":128000,"status":1,"display_name":"MiniMaxAI/MiniMax-M1-80k","model_type":"chat","max_output_tokens":40000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1745898441,"id":"qwen/qwen3-235b-a22b-fp8","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":14500,"output_token_price_per_m":58000,"pricing":{"prompt":{"origin_price_per_m":14500,"price_per_m":14500},"completion":{"origin_price_per_m":58000,"price_per_m":58000}},"is_tiered_billing":false,"title":"qwen/qwen3-235b-a22b-fp8","description":"实现推理模式和非推理模式的有效融合，可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-72B-Instruct，达到同规模业界SOTA水平。","tags":[],"context_size":40960,"status":1,"display_name":"Qwen3-235B-A22B","model_type":"chat","max_output_tokens":20000,"features":["reasoning","serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1745898548,"id":"qwen/qwen3-32b-fp8","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":7200,"output_token_price_per_m":32600,"pricing":{"prompt":{"origin_price_per_m":7200,"price_per_m":7200},"completion":{"origin_price_per_m":32600,"price_per_m":32600}},"is_tiered_billing":false,"title":"qwen/qwen3-32b-fp8","description":"实现推理模式和非推理模式的有效融合，可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-32B-Instruct，达到同规模业界SOTA水平。","tags":[],"context_size":128000,"status":4,"display_name":"Qwen3 32B","model_type":"chat","max_output_tokens":20000,"features":["reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1745898496,"id":"qwen/qwen3-30b-a3b-fp8","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":7200,"output_token_price_per_m":32600,"pricing":{"prompt":{"origin_price_per_m":7200,"price_per_m":7200},"completion":{"origin_price_per_m":32600,"price_per_m":32600}},"is_tiered_billing":false,"title":"qwen/qwen3-30b-a3b-fp8","description":"实现推理模式和非推理模式的有效融合，可在对话中切换模式。推理能力以更小参数规模比肩QwQ-32B、通用能力显著超过Qwen2.5-14B，达到同规模业界SOTA水平。","tags":[],"context_size":40960,"status":4,"display_name":"Qwen3-30B-A3B","model_type":"chat","max_output_tokens":20000,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1746010764,"id":"deepseek/deepseek-prover-v2-671b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"deepseek/deepseek-prover-v2-671b","description":"Deepseek 全新开源模型 DeepSeek-Prover-V2-671B，专注于数学定理证明任务。该模型基于混合专家 (MoE) 架构，并利用 Lean 4 框架进行形式化推理训练。该模型参数规模达 6710 亿，结合强化学习和大规模合成数据，显著提升了自动化证明能力。","tags":[],"context_size":160000,"status":4,"display_name":"Deepseek Prover V2 671B","model_type":"chat","max_output_tokens":160000,"features":["serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1782806105,"id":"qwen/qwen3.5-omni-flash","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":22000,"output_token_price_per_m":133000,"pricing":{"prompt":{"origin_price_per_m":22000,"price_per_m":22000},"completion":{"origin_price_per_m":133000,"price_per_m":133000},"multimodal_input":[{"modals":["audio"],"input_token_base_price":180000,"input_token_discount_price":180000},{"modals":["text"],"input_token_base_price":22000,"input_token_discount_price":22000},{"modals":["image"],"input_token_base_price":22000,"input_token_discount_price":22000},{"modals":["video"],"input_token_base_price":22000,"input_token_discount_price":22000},{"modals":["text","image","video"],"input_token_base_price":22000,"input_token_discount_price":22000}],"multimodal_output":[{"modals":["text"],"output_token_base_price":133000,"output_token_discount_price":133000},{"modals":["audio"],"output_token_base_price":720000,"output_token_discount_price":720000}]},"is_tiered_billing":false,"title":"qwen/qwen3.5-omni-flash","description":"Qwen3.5-Omni是Qwen最新一代全模态大模型，支持文本，图片，音频，音视频理解与交互。作为 Qwen3-Omni 的全面进化版本， 支持超过 10 小时的音频理解及超过 400 秒的 720P（1 FPS）音视频理解与对话，并进一步拓展语言范围，支持60+种语言音频输入，30+语言语音输出，并且具备强大的结构化音视频理解能力，广泛应用于文本创作、语音助手、多媒体分析等场景，提供自然流畅的多模态理解与交互体验。","tags":[],"context_size":262144,"status":1,"display_name":"Qwen3.5 Omni Flash","model_type":"chat","max_output_tokens":65536,"features":["serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video","audio"],"output_modalities":["text","audio"]},{"created":1759991187,"id":"qwen/qwen3-coder-30b-a3b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":22500,"output_token_price_per_m":90000,"pricing":{"prompt":{"origin_price_per_m":22500,"price_per_m":22500},"completion":{"origin_price_per_m":90000,"price_per_m":90000}},"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32768,"pricing":{"prompt":{"origin_price_per_m":15000,"price_per_m":15000},"completion":{"origin_price_per_m":60000,"price_per_m":60000}}},{"min_tokens":32768,"max_tokens":131072,"pricing":{"prompt":{"origin_price_per_m":22500,"price_per_m":22500},"completion":{"origin_price_per_m":90000,"price_per_m":90000}}},{"min_tokens":131072,"max_tokens":204800,"pricing":{"prompt":{"origin_price_per_m":37500,"price_per_m":37500},"completion":{"origin_price_per_m":150000,"price_per_m":150000}}}],"title":"qwen/qwen3-coder-30b-a3b-instruct","description":"Qwen3-Coder-30B-A3B-Instruct 是一个拥有305亿参数的专家混合（MoE）模型，配备128个专家（每次前向传播激活8个），专为高级代码生成、存储库级理解和代理工具使用而设计。基于Qwen3架构构建，支持256K令牌的原生上下文长度（通过Yarn可扩展至100万），在涉及函数调用、浏览器使用和结构化代码补全的任务中表现出色。","tags":[],"context_size":262144,"status":4,"display_name":"Qwen3 Coder 30b A3B Instruct","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1741089539,"id":"deepseek/deepseek-r1-turbo","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"deepseek/deepseek-r1-turbo","description":"DeepSeek R1 (Turbo)是派欧算力云平台提供的最新高性能DeepSeek R1 模型。DeepSeek R1是DeepSeek团队发布的最新开源模型，具备非常强悍的推理性能，尤其在数学、编程和推理任务上达到了与OpenAI的o1模型相当的水平。","tags":[],"context_size":64000,"status":4,"display_name":"DeepSeek R1 (Turbo)","model_type":"chat","max_output_tokens":16000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1752056258,"id":"thudm/glm-4.1v-9b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2500,"output_token_price_per_m":10000,"pricing":{"prompt":{"origin_price_per_m":2500,"price_per_m":2500},"completion":{"origin_price_per_m":10000,"price_per_m":10000}},"is_tiered_billing":false,"title":"thudm/glm-4.1v-9b-thinking","description":"GLM-4.1V-9B-Thinking 是由智谱 AI 与清华大学 KEG 实验室联合发布的开源视觉语言模型（VLM），专为处理复杂的多模态认知任务设计。该模型是基于 GLM-4-9B-0414 基础模型，通过引入“思维链”（CoT）推理机制和采用强化学习策略，显著提升了跨模态的推理能力和稳定性。作为一个 9B 参数规模的轻量级模型，它在部署效率和性能之间取得了平衡，在 28 项权威评测基准中，有 18 项的表现持平甚至超越了 72B 参数规模的 Qwen-2.5-VL-72B。该模型不仅在图文理解、数学科学推理、视频理解等任务上表现卓越，还支持高达 4K 分辨率的图像和任意宽高比输入","tags":[],"context_size":65536,"status":1,"display_name":"GLM 4.1V 9B Thinking","model_type":"chat","max_output_tokens":32000,"features":["reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1748458273,"id":"deepseek/deepseek-r1-0528","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"deepseek/deepseek-r1-0528","description":"DeepSeek R1 0528 是派欧云平台提供的最新高性能DeepSeek R1 模型。DeepSeek R1 0528 是DeepSeek团队发布的最新开源模型，具备非常强悍的推理性能，尤其在编程、数学、推理任务上达到了开源模型最先进的水平。","tags":[],"context_size":163840,"status":4,"display_name":"deepseek/deepseek-r1-0528","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1741084845,"id":"deepseek/deepseek-v3-turbo","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":80000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3-turbo","description":"DeepSeek V3 (Turbo) 是派欧算力云平台提供的最新高性能DeepSeek V3 模型。DeepSeek-V3 在推理速度方面实现了比之前模型的重大突破。在开源模型中排名第一，并可与全球最先进的闭源模型相媲美。DeepSeek-V3 采用了多头潜在注意力 （MLA） 和 DeepSeekMoE 架构，这些架构在 DeepSeek-V2 中得到了全面验证。此外，DeepSeek-V3 开创了一种用于负载均衡的辅助无损策略，并设定了多标记预测训练目标以获得更强的性能。","tags":[],"context_size":64000,"status":1,"display_name":"DeepSeek V3 (Turbo)","model_type":"chat","max_output_tokens":16000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1737896010,"id":"deepseek/deepseek-r1","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"deepseek/deepseek-r1","description":"DeepSeek R1是DeepSeek团队发布的最新开源模型，具备非常强悍的推理性能，尤其在数学、编程和推理任务上达到了与OpenAI的o1模型相当的水平。","tags":[],"context_size":64000,"status":4,"display_name":"DeepSeek R1","model_type":"chat","max_output_tokens":8000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1757534080,"id":"qwen/qwen3-next-80b-a3b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":40000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":40000,"price_per_m":40000}},"is_tiered_billing":false,"title":"qwen/qwen3-next-80b-a3b-instruct","description":"Qwen3-Next采用高度稀疏的混合专家(MoE)架构设计：模型总参数量达800亿，但每次推理仅激活约30亿参数。实验数据显示，在全局负载均衡机制下，保持激活专家数量不变而持续增加总专家参数量，能有效降低训练损失。相比前代Qwen3的MoE架构（128个总专家，8个路由专家），Qwen3-Next将专家规模扩展至512个，创新采用\"10个路由专家+1个共享专家\"的组合方案，在最大化资源利用率的同时确保性能无损。\n特别值得注意的是，Qwen3-Next-80B-A3B-Instruct版本在性能表现上已接近我们的旗舰模型Qwen3-235B-A22B-Instruct-2507，并在处理超长上下文（最高支持256K tokens）的任务中展现出显著优势。\n","tags":[],"context_size":65536,"status":4,"display_name":"Qwen3 Next 80B A3B Instruct","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1737540619,"id":"deepseek/deepseek-v3","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":80000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3","description":"DeepSeek-V3在推理速度方面实现了比之前模型的重大突破。在开源模型中排名第一，并可与全球最先进的闭源模型相媲美。DeepSeek-V3 采用了多头潜在注意力 （MLA） 和 DeepSeekMoE 架构，这些架构在 DeepSeek-V2 中得到了全面验证。此外，DeepSeek-V3 开创了一种用于负载均衡的辅助无损策略，并设定了多标记预测训练目标以获得更强的性能。","tags":[],"context_size":64000,"status":1,"display_name":"DeepSeek V3","model_type":"chat","max_output_tokens":8000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1757534015,"id":"qwen/qwen3-next-80b-a3b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":100000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":100000,"price_per_m":100000}},"is_tiered_billing":false,"title":"qwen/qwen3-next-80b-a3b-thinking","description":"\nQwen3-Next采用高度稀疏的混合专家（MoE）架构设计：总参数量达800亿，但每个推理步骤仅激活约30亿参数。实验表明，在全局负载均衡机制下，保持激活专家数量不变而增加总专家参数量，能够持续降低训练损失。相较于Qwen3的MoE结构（128个总专家，8个路由专家），Qwen3-Next将规模扩展至512个总专家，创新性地采用\"10个路由专家+1个共享专家\"的组合策略——在最大化资源利用率的同时确保模型性能不受影响。\n其中，Qwen3-Next-80B-A3B-Thinking在复杂推理任务中表现卓越：其性能不仅超越更高成本的Qwen3-30B-A3B-Thinking-2507和Qwen3-32B-Thinking等模型，在多项基准测试中更胜过闭源的Gemini-2.5-Flash-Thinking，并逼近我们的旗舰模型Qwen3-235B-A22B-Thinking-2507的性能水平。\n","tags":[],"context_size":65536,"status":4,"display_name":"Qwen3 Next 80B A3B Thinking","model_type":"chat","max_output_tokens":65536,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1738928844,"id":"deepseek/deepseek-v3/community","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":80000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":80000,"price_per_m":80000}},"is_tiered_billing":false,"title":"deepseek/deepseek-v3/community","description":"DeepSeek-V3在推理速度方面实现了比之前模型的重大突破。在开源模型中排名第一，并可与全球最先进的闭源模型相媲美。DeepSeek-V3 采用了多头潜在注意力 （MLA） 和 DeepSeekMoE 架构，这些架构在 DeepSeek-V2 中得到了全面验证。此外，DeepSeek-V3 开创了一种用于负载均衡的辅助无损策略，并设定了多标记预测训练目标以获得更强的性能。","tags":[],"context_size":64000,"status":1,"display_name":"DeepSeek V3 (Community)","model_type":"chat","max_output_tokens":4000,"features":["function-calling","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1738928740,"id":"deepseek/deepseek-r1/community","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":160000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":160000,"price_per_m":160000}},"is_tiered_billing":false,"title":"deepseek/deepseek-r1/community","description":"DeepSeek R1是DeepSeek团队发布的最新开源模型，具备非常强悍的推理性能，尤其在数学、编程和推理任务上达到了与OpenAI的o1模型相当的水平。","tags":[],"context_size":64000,"status":4,"display_name":"DeepSeek R1 (Community)","model_type":"chat","max_output_tokens":4000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1751258239,"id":"baidu/ernie-4.5-vl-424b-a47b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":30000,"output_token_price_per_m":90000,"pricing":{"prompt":{"origin_price_per_m":30000,"price_per_m":30000},"completion":{"origin_price_per_m":90000,"price_per_m":90000}},"is_tiered_billing":false,"title":"baidu/ernie-4.5-vl-424b-a47b","description":"文心4.5系列开源模型为MoE 架构，是一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。该模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。","tags":[],"context_size":123000,"status":1,"display_name":"ERNIE-4.5-VL-424B-A47B","model_type":"chat","max_output_tokens":16000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1751240593,"id":"baidu/ernie-4.5-300b-a47b-paddle","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":20000,"output_token_price_per_m":70000,"pricing":{"prompt":{"origin_price_per_m":20000,"price_per_m":20000},"completion":{"origin_price_per_m":70000,"price_per_m":70000}},"is_tiered_billing":false,"title":"baidu/ernie-4.5-300b-a47b-paddle","description":"文心4.5系列开源模型为MoE 架构，是一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。该模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。","tags":[],"context_size":123000,"status":4,"display_name":"ERNIE-4.5-300B-A47B","model_type":"chat","max_output_tokens":12000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1738056746,"id":"deepseek/deepseek-r1-distill-llama-70b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":58000,"output_token_price_per_m":58000,"pricing":{"prompt":{"origin_price_per_m":58000,"price_per_m":58000},"completion":{"origin_price_per_m":58000,"price_per_m":58000}},"is_tiered_billing":false,"title":"deepseek/deepseek-r1-distill-llama-70b","description":"DeepSeek R1 Distill Llama 70B是基于Llama3.3  70B的大型语言模型，该模型利用DeepSeek R1输出的微调，实现了与大型前沿模型相当的竞争性能。","tags":[],"context_size":32000,"status":1,"display_name":"DeepSeek R1 Distill Llama 70B","model_type":"chat","max_output_tokens":8000,"features":["structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1733473730,"id":"qwen/qwen-2.5-72b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":40000,"output_token_price_per_m":120000,"pricing":{"prompt":{"origin_price_per_m":40000,"price_per_m":40000},"completion":{"origin_price_per_m":120000,"price_per_m":120000}},"is_tiered_billing":false,"title":"qwen/qwen-2.5-72b-instruct","description":"Qwen2.5-72B-Instruct 是阿里云发布的最新大语言模型系列之一。该 72B 模型在编码和数学等领域具有显著改进的能力。该模型还提供了多语言支持，覆盖超过 29 种语言，包括中文、英文等。模型在指令跟随、理解结构化数据以及生成结构化输出（尤其是 JSON）方面都有显著提升。","tags":[],"context_size":32000,"status":1,"display_name":"Qwen2.5 72B Instruct","model_type":"chat","max_output_tokens":16000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1742894180,"id":"qwen/qwen2.5-vl-72b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":42000,"output_token_price_per_m":42000,"pricing":{"prompt":{"origin_price_per_m":42000,"price_per_m":42000},"completion":{"origin_price_per_m":42000,"price_per_m":42000}},"is_tiered_billing":false,"title":"qwen/qwen2.5-vl-72b-instruct","description":"Qwen2.5-VL 是 Qwen2.5 系列最新推出的视觉语言模型。该模型在多方面有显著提升：具备更强的视觉理解能力，能够识别常见物体、分析文本、图表和布局；作为视觉代理能够推理并动态指导工具使用；支持理解超过 1 小时的长视频并捕捉关键事件；能够通过生成边界框或点准确定位图像中的物体；支持生成结构化输出，尤其适用于发票、表格等扫描数据。模型在多项基准测试中表现出色，包括图像、视频和代理任务评测。","tags":[],"context_size":32000,"status":4,"display_name":"Qwen2.5 VL 72B Instruct","model_type":"chat","max_output_tokens":32000,"features":["serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text","video","image"],"output_modalities":["text"]},{"created":1732525721,"id":"qwen/qwen2.5-32b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":12600,"output_token_price_per_m":12600,"pricing":{"prompt":{"origin_price_per_m":12600,"price_per_m":12600},"completion":{"origin_price_per_m":12600,"price_per_m":12600}},"is_tiered_billing":false,"title":"qwen/qwen2.5-32b-instruct","description":"Qwen2.5-32B-Instruct 是阿里云发布的最新大语言模型系列之一。该 32B 模型在编码和数学等领域具有显著改进的能力。该模型提供了多语言支持，覆盖超过 29 种语言，包括中文、英文等。模型在指令跟随、理解结构化数据以及生成结构化输出（尤其是 JSON）方面都有显著提升。","tags":[],"context_size":32000,"status":4,"display_name":"Qwen2.5 32B Instruct","model_type":"chat","max_output_tokens":32000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1744798863,"id":"thudm/glm-4-32b-0414","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":17500,"output_token_price_per_m":17500,"pricing":{"prompt":{"origin_price_per_m":17500,"price_per_m":17500},"completion":{"origin_price_per_m":17500,"price_per_m":17500}},"is_tiered_billing":false,"title":"thudm/glm-4-32b-0414","description":"GLM-4-32B-0414 是 GLM 系列的新一代开源模型，拥有 320 亿参数。该模型性能可与 OpenAI 的 GPT 系列和 DeepSeek 的 V3/R1 系列相媲美，并支持非常用户友好的本地部署功能。GLM-4-32B-Base-0414 是在 15T 高质量数据上预训练的，包括大量推理类型的合成数据，为后续的强化学习扩展奠定了基础。在后训练阶段，除了对话场景的人类偏好对齐外，研究团队还使用拒绝采样和强化学习等技术增强了模型在指令遵循、工程代码和函数调用方面的表现，加强了代理任务所需的原子能力。GLM-4-32B-0414 在工程代码、Artifact 生成、函数调用、基于搜索的问答和报告生成等领域取得了良好的成果，部分 Benchmark 指标已接近甚至超越 GPT-4o、DeepSeek-V3-0324（671B）等更大模型的水平。","tags":[],"context_size":32000,"status":1,"display_name":"THUDM/GLM-4-32B-0414","model_type":"chat","max_output_tokens":32000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1744797656,"id":"qwen/qwen2.5-7b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":3500,"output_token_price_per_m":3500,"pricing":{"prompt":{"origin_price_per_m":3500,"price_per_m":3500},"completion":{"origin_price_per_m":3500,"price_per_m":3500}},"is_tiered_billing":false,"title":"qwen/qwen2.5-7b-instruct","description":"Qwen2.5 是 Qwen 大语言模型的最新系列。在 Qwen2.5 中，发布了多个基础语言模型和指令微调语言模型，参数规模从 0.5 亿到 720 亿不等。相比 Qwen2，Qwen2.5 带来了以下显著提升：\n- 知识储备显著提升，并在编程和数学能力上有大幅增强，这得益于我们在这些领域训练的专业专家模型。\n- 在指令理解与执行、生成长文本（超过8K tokens）、理解结构化数据（如表格）、以及生成结构化输出（尤其是 JSON）方面表现大幅提升。对多样化的系统提示更具适应性，增强了角色扮演实现和聊天机器人的条件设定能力。\n- 长上下文支持扩展至最多 128K tokens，最多可生成 8K tokens 的内容。\n- 多语言支持涵盖超过 29 种语言，包括中文、英文、法语、西班牙语、葡萄牙语、德语、意大利语、俄语、日语、韩语、越南语、泰语、阿拉伯语等。","tags":[],"context_size":32000,"status":4,"display_name":"Qwen 2.5 7B Instruct","model_type":"chat","max_output_tokens":32000,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions","completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1785831958,"id":"pprouter/fusion","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"pprouter/fusion","description":"","tags":[],"context_size":1048576,"status":1,"display_name":"pprouter/fusion","model_type":"chat","max_output_tokens":393216,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1785401748,"id":"pprouter/mom","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"pprouter/mom","description":"","tags":[],"context_size":1048576,"status":1,"display_name":"pprouter/mom","model_type":"chat","max_output_tokens":131072,"features":["serverless","function-calling","structured-outputs","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776784876,"id":"elephant","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"elephant","description":"","tags":[],"context_size":262144,"status":1,"display_name":"Ling-2.6-flash","model_type":"chat","max_output_tokens":32768,"features":["serverless","function-calling","structured-outputs"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776413144,"id":"ai_infer_test_2","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"ai_infer_test_2","description":"","tags":[],"context_size":200000,"status":1,"display_name":"ai_infer_test_2","model_type":"chat","max_output_tokens":200000,"features":["serverless","function-calling","structured-outputs"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1776413120,"id":"ai_infer_test_3","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"ai_infer_test_3","description":"","tags":[],"context_size":200000,"status":1,"display_name":"ai_infer_test_3","model_type":"chat","max_output_tokens":200000,"features":["serverless","function-calling","structured-outputs"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1773821813,"id":"ppio-4b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2145,"output_token_price_per_m":2145,"pricing":{"prompt":{"origin_price_per_m":2145,"price_per_m":2145},"completion":{"origin_price_per_m":2145,"price_per_m":2145}},"is_tiered_billing":false,"title":"ppio-4b","description":"PPIO 4B 是由 PPIO 团队研发的4B级别大语言模型。\n双模式灵活切换：业内领先地实现了“思考模式”与“非思考模式”的有效融合，支持在对话中自由切换，从容应对不同复杂度的任务。\n同规模 SOTA 推理：硬核算力优化，逻辑推理能力稳居同等规模模型业界第一梯队。\n全方位能力进化：人类偏好对齐能力显著增强。在创意写作、角色扮演、多轮对话及指令遵循等核心场景中均有大幅提升，为您提供超预期的极佳用户体验。\n","tags":[],"context_size":128000,"status":1,"display_name":"PPIO 4B","model_type":"chat","max_output_tokens":8192,"features":["serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1769417258,"id":"baidu/ernie-5.0-thinking-exp","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32000,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":240000,"price_per_m":240000}}},{"min_tokens":32000,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":100000,"price_per_m":100000},"completion":{"origin_price_per_m":400000,"price_per_m":400000}}}],"title":"baidu/ernie-5.0-thinking-exp","description":"文心新一代模型文心5.0是原生全模态大模型，采用原生的全模态统一建模技术，将文本、图像、音频、视频联合建模，具备综合的全模态能力。文心5.0基础能力全面升级，基准测试集表现出色，多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等表现尤其出色。","tags":[],"context_size":183000,"status":1,"display_name":"Ernie 5.0 Thinking Exp","model_type":"chat","max_output_tokens":64000,"features":["serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1769416125,"id":"baidu/ernie-5.0-thinking-preview","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":true,"tiered_billing_configs":[{"min_tokens":1,"max_tokens":32000,"pricing":{"prompt":{"origin_price_per_m":60000,"price_per_m":60000},"completion":{"origin_price_per_m":240000,"price_per_m":240000}}},{"min_tokens":32000,"max_tokens":128000,"pricing":{"prompt":{"origin_price_per_m":100000,"price_per_m":100000},"completion":{"origin_price_per_m":400000,"price_per_m":400000}}}],"title":"baidu/ernie-5.0-thinking-preview","description":"文心新一代模型文心5.0是原生全模态大模型，采用原生的全模态统一建模技术，将文本、图像、音频、视频联合建模，具备综合的全模态能力。文心5.0基础能力全面升级，基准测试集表现出色，多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等表现尤其出色。","tags":[],"context_size":183000,"status":1,"display_name":"Ernie 5.0 Thinking Preview","model_type":"chat","max_output_tokens":64000,"features":["serverless","function-calling","reasoning"],"endpoints":["chat/completions"],"input_modalities":["text","image","video","audio"],"output_modalities":["text"]},{"created":1765882054,"id":"baidu/ernie-4.5-21b-a3b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":5000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":5000,"price_per_m":5000},"completion":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"baidu/ernie-4.5-21b-a3b-thinking","description":"ERNIE-4.5-21B-A3B-Thinking 是一个文本 MoE 后训练模型，每个 token 有 21B 总参数和 3B 激活参数，提高了推理任务的性能，包括逻辑推理、数学、科学、编码、文本生成和通常需要人类专业知识的学术基准。具备高效的工具使用能力，达到 128K 长上下文理解能力。","tags":[],"context_size":131072,"status":4,"display_name":"Ernie 4.5 21B A3B Thinking","model_type":"chat","max_output_tokens":65536,"features":["reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1760687912,"id":"qwen/qwen3-vl-8b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":5000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":5000,"price_per_m":5000},"completion":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"qwen/qwen3-vl-8b-instruct","description":"Qwen3-VL-8B-Instruct 是 Qwen3-VL 系列中的一款多模态视觉语言模型，专为高保真度的文本、图像和视频理解与推理而打造。\n该模型采用增强的多模态融合技术，包括：\n- Interleaved-MRoPE：用于长时间序列的时间推理；\n- DeepStack：实现精细级别的视觉—文本对齐；\n- 文本-时间戳对齐机制：用于精准的事件定位。\n模型原生支持 256K Token 上下文窗口，并可扩展至 100万 Token，能够同时处理静态与动态媒体输入，适用于文档解析、视觉问答、空间推理以及 GUI 控制等任务。\n其文本理解能力可与领先的大语言模型相媲美，同时扩展了 32种语言的OCR识别能力，并在多样化视觉条件下具备更强的鲁棒性与稳定性。","tags":[],"context_size":131072,"status":4,"display_name":"qwen/qwen3-vl-8b-instruct","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1760428378,"id":"kwaipilot/kat-dev-72b-exp","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"kwaipilot/kat-dev-72b-exp","description":"","tags":[],"context_size":131072,"status":1,"display_name":"KAT-Dev-72B-Exp","model_type":"chat","max_output_tokens":65536,"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1760424157,"id":"zai-org/glm-4.5-air","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":12000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":12000,"price_per_m":12000},"completion":{"origin_price_per_m":20000,"price_per_m":20000},"input_cache_read":{"origin_price_per_m":2400,"price_per_m":2400}},"is_tiered_billing":false,"title":"zai-org/glm-4.5-air","description":"GLM-4.5-Air 是我们最新旗舰模型系列的轻量化版本，同时专为智能体（Agent）中心应用而设计。与 GLM-4.5 一样，它采用专家混合（Mixture-of-Experts，MoE）架构，但参数规模更加紧凑。\nGLM-4.5-Air 支持混合推理模式，提供两种工作模式：\n- 思考模式（Thinking Mode）：用于高级推理和工具调用；\n- 非思考模式（Non-Thinking Mode）：用于实时交互与快速响应。\n用户可以通过布尔参数 reasoning_enabled 来控制模型的推理行为","tags":[],"context_size":131072,"status":1,"display_name":"zai-org/glm-4.5-air","model_type":"chat","max_output_tokens":98304,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions","anthropic"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1760182249,"id":"qwen/qwen3-vl-30b-a3b-thinking","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":7500,"output_token_price_per_m":75000,"pricing":{"prompt":{"origin_price_per_m":7500,"price_per_m":7500},"completion":{"origin_price_per_m":75000,"price_per_m":75000}},"is_tiered_billing":false,"title":"qwen/qwen3-vl-30b-a3b-thinking","description":"Qwen3-VL-30B-A3B-Thinking 是一款多模态模型，将强大的文本生成能力与对图像和视频的视觉理解深度融合。其 “Thinking” 版本在 STEM、数学和复杂推理任务上具备强化的思考与推理能力。\n 该模型在真实世界与合成场景的识别、二维/三维空间理解以及长篇视觉内容理解等方面表现出色，在多模态基准测试中取得了具有竞争力的成绩。\n在智能体（Agent）应用场景中，它能够处理多图像、多轮指令、视频时间轴对齐、GUI自动化等任务，还能从草图生成到调试完善可用的用户界面，实现视觉编程。\n 其文本生成性能与 Qwen3 系列旗舰模型相当，适用于文档智能（Document AI）、OCR识别、界面辅助、空间任务以及智能体研究等多种场景。","tags":[],"context_size":131072,"status":4,"display_name":"qwen/qwen3-vl-30b-a3b-thinking","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1760182215,"id":"qwen/qwen3-vl-30b-a3b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":7500,"output_token_price_per_m":30000,"pricing":{"prompt":{"origin_price_per_m":7500,"price_per_m":7500},"completion":{"origin_price_per_m":30000,"price_per_m":30000}},"is_tiered_billing":false,"title":"qwen/qwen3-vl-30b-a3b-instruct","description":"Qwen3-VL-30B-A3B-Instruct 是一款多模态模型，将强大的文本生成能力与对图像和视频的视觉理解深度融合。其 “Instruct” 版本专为多模态任务中的指令跟随能力进行优化。\n 该模型在真实世界与合成场景的识别、二维/三维空间理解，以及长篇视觉内容理解等方面表现卓越，并在多模态基准测试中取得了领先的成绩。\n在智能体（Agent）应用中，它能够处理多图像、多轮指令、视频时间轴对齐、GUI自动化等复杂任务，还能实现从草图到调试完善的用户界面视觉编程。\n 其文本生成能力与 Qwen3 系列旗舰模型相当，适用于文档智能（Document AI）、OCR识别、界面辅助、空间任务以及智能体研究等多种场景。","tags":[],"context_size":131072,"status":4,"display_name":"qwen/qwen3-vl-30b-a3b-instruct","model_type":"chat","max_output_tokens":32768,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video"],"output_modalities":["text"]},{"created":1758695302,"id":"qwen/qwen3-omni-30b-a3b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":18000,"output_token_price_per_m":69000,"pricing":{"prompt":{"origin_price_per_m":18000,"price_per_m":18000},"completion":{"origin_price_per_m":69000,"price_per_m":69000},"multimodal_input":[{"modals":["text"],"input_token_base_price":18000,"input_token_discount_price":18000},{"modals":["audio"],"input_token_base_price":158000,"input_token_discount_price":158000},{"modals":["image"],"input_token_base_price":33000,"input_token_discount_price":33000},{"modals":["video"],"input_token_base_price":33000,"input_token_discount_price":33000},{"modals":["image","video"],"input_token_base_price":33000,"input_token_discount_price":33000}],"multimodal_output":[{"modals":["text"],"output_token_base_price":69000,"output_token_discount_price":69000},{"modals":["audio"],"output_token_base_price":626000,"output_token_discount_price":626000}]},"is_tiered_billing":false,"title":"qwen/qwen3-omni-30b-a3b-instruct","description":"Qwen-Omni 模型能够接收文本与单一其他模态（图片、音频、视频）的组合输入，并生成文本或语音形式的回复， 提供多种拟人音色，支持多语言和方言的语音输出，可应用于文本创作、视觉识别、语音助手等场景。","tags":[],"context_size":65536,"status":1,"display_name":"qwen/qwen3-omni-30b-a3b-instruct","model_type":"chat","max_output_tokens":16384,"features":["function-calling","structured-outputs","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image","video","audio"],"output_modalities":["text","audio"]},{"created":1758695277,"id":"qwen/qwen3-omni-30b-a3b-captioner","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"qwen/qwen3-omni-30b-a3b-captioner","description":"","tags":[],"context_size":0,"status":1,"display_name":"qwen/qwen3-omni-30b-a3b-captioner","model_type":"chat","endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1751258298,"id":"baidu/ernie-4.5-0.3b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":0,"output_token_price_per_m":0,"is_tiered_billing":false,"title":"baidu/ernie-4.5-0.3b","description":"文心4.5系列开源模型为MoE 架构，是一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。该模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。","tags":[],"context_size":120000,"status":4,"display_name":"ERNIE-4.5-0.3B","model_type":"chat","max_output_tokens":8000,"features":["function-calling","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1751258188,"id":"baidu/ernie-4.5-21B-a3b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":5000,"output_token_price_per_m":20000,"pricing":{"prompt":{"origin_price_per_m":5000,"price_per_m":5000},"completion":{"origin_price_per_m":20000,"price_per_m":20000}},"is_tiered_billing":false,"title":"baidu/ernie-4.5-21B-a3b","description":"\n文心4.5系列开源模型为MoE 架构，是一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。该模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。","tags":[],"context_size":120000,"status":4,"display_name":"ERNIE-4.5-21B-A3B","model_type":"chat","max_output_tokens":8000,"features":["function-calling","serverless"],"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1751258092,"id":"baidu/ernie-4.5-vl-28b-a3b","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":10000,"output_token_price_per_m":40000,"pricing":{"prompt":{"origin_price_per_m":10000,"price_per_m":10000},"completion":{"origin_price_per_m":40000,"price_per_m":40000}},"is_tiered_billing":false,"title":"baidu/ernie-4.5-vl-28b-a3b","description":"\n文心4.5系列开源模型为MoE 架构，是一种创新性的多模态异构模型结构，通过跨模态参数共享机制实现模态间知识融合，同时为各单一模态保留专用参数空间。此架构非常适用于从大语言模型向多模态模型的持续预训练范式，在保持甚至提升文本任务性能的基础上，显著增强多模态理解能力。该模型均使用飞桨深度学习框架进行高效训练、推理和部署。在大语言模型的预训练中，模型FLOPs利用率（MFU）达到47%。实验结果显示，该系列模型在多个文本和多模态基准测试中达到SOTA水平，在指令遵循、世界知识记忆、视觉理解和多模态推理任务上效果尤为突出。","tags":[],"context_size":30000,"status":4,"display_name":"ERNIE-4.5-VL-28B-A3B","model_type":"chat","max_output_tokens":8000,"features":["function-calling","structured-outputs","reasoning","serverless"],"endpoints":["chat/completions"],"input_modalities":["text","image"],"output_modalities":["text"]},{"created":1745902139,"id":"qwen/qwen3-4b-fp8","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":2145,"output_token_price_per_m":2145,"pricing":{"prompt":{"origin_price_per_m":2145,"price_per_m":2145},"completion":{"origin_price_per_m":2145,"price_per_m":2145}},"is_tiered_billing":false,"title":"qwen/qwen3-4b-fp8","description":"实现思考模式和非思考模式的有效融合，可在对话中切换模式。推理能力达到同规模业界SOTA水平、模型人类偏好能力显著增强，创意写作、角色扮演、多轮对话、指令遵循能力均有明显提升，用户体验预期明显更佳。","tags":[],"context_size":128000,"status":4,"display_name":"Qwen3 4B","model_type":"chat","max_output_tokens":20000,"features":["function-calling","reasoning","serverless"],"endpoints":["chat/completions","completions","batch-api"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1724197179,"id":"qwen/qwen-2-7b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":3200,"output_token_price_per_m":3200,"pricing":{"prompt":{"origin_price_per_m":3200,"price_per_m":3200},"completion":{"origin_price_per_m":3200,"price_per_m":3200}},"is_tiered_billing":false,"title":"qwen/qwen-2-7b-instruct","description":"Qwen2是全新的Qwen大型语言模型系列。Qwen2 7B是一个基于transformer的模型，在语言理解、多语言能力、编程、数学和推理方面表现出色。","tags":[],"context_size":32768,"status":4,"display_name":"Qwen2 7B Instruct","model_type":"chat","max_output_tokens":32000,"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]},{"created":1734598279,"id":"qwen/qwen-2-vl-72b-instruct","object":"model","owned_by":"unknown","permission":null,"root":"","parent":"","input_token_price_per_m":45000,"output_token_price_per_m":45000,"pricing":{"prompt":{"origin_price_per_m":45000,"price_per_m":45000},"completion":{"origin_price_per_m":45000,"price_per_m":45000}},"is_tiered_billing":false,"title":"qwen/qwen-2-vl-72b-instruct","description":"Qwen2-VL 是 Qwen-VL 模型的最新迭代版本，在视觉理解基准测试中达到了最先进的性能，包括 MathVista、DocVQA、RealWorldQA 和 MTVQA 等。Qwen2-VL 能够理解超过 20 分钟的视频，用于高质量的基于视频的问答、对话和内容创作。它还具备复杂推理和决策能力，可以与移动设备、机器人等集成，基于视觉环境和文本指令进行自动操作。除了英语和中文，Qwen2-VL 现在还支持理解图像中不同语言的文本，包括大多数欧洲语言、日语、韩语、阿拉伯语和越南语等","tags":[],"context_size":32768,"status":4,"display_name":"Qwen2 VL 72B Instruct","model_type":"chat","max_output_tokens":8000,"endpoints":["chat/completions"],"input_modalities":["text"],"output_modalities":["text"]}]}
