AI 模型库
主流 AI 大模型档案库:上下文窗口、定价、基准测试、优劣分析、适用场景,帮你选对模型。
Qwen-Image-2.1
阿里云通义千问
阿里通义千问 Qwen-Image-2.1 详解:7B(7.1B DiT)开源权重,生成与编辑合一,原生 RGBA 透明输出,单次最多 10 张参考图,默认 2K 出图。Day-0 支持 ComfyUI / Diffusers / vLLM-Omni / SGLang,RTX 4090 上 1024×1024 约 18.7 秒。采用 Qwen 研究许可,商用需另议。
Qwen3.8-LiveTranslate
阿里巴巴(通义千问)
阿里千问 2026-09-19 发布的实时同声传译大模型:Interleave 架构 + Hybrid MoE Thinker–Talker 双模块,字均延迟(LAAL)2.8 秒降至 2.3 秒,支持 60 种语言;新增实时说话人分离、原文译文同帧同出、长上下文消歧三大能力,官方评测在 Omnilingua-MSpeaker 与 FLEURS 上领先主流实时同传系统。
阶跃星辰 Step 5 Preview
阶跃星辰
阶跃星辰(StepFun)Step 5 Preview 模型详解:600B 稀疏 MoE(激活约 27B)、92 层窄深结构、1M 上下文,主打长程 Agent 与编程。Artificial Analysis 智能指数 44,API 价 $1/$2.7 每百万 token,BF16 权重计划 2026-10-15 开放。
星辰 Xing4.0-29B-A4B
中国电信
中国电信 2026-09-17 发布的星辰 Xing4.0-29B-A4B,MoE 架构总参 29B、激活 4B,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数模型;低比特量化后可在消费级显卡本地运行,已开源上线多个社区。
Gemini 3.8 Live
Google DeepMind
Google DeepMind 于 2026-09-15 发布的原生语音到语音(speech-to-speech)实时对话模型,含标准版与 Extended Thinking 两个版本。Extended Thinking 可在说话的同时后台推理、异步调用工具并实时汇报进度,以 82.6 分登顶 Artificial Analysis 语音质量指数;实测每小时输入音频成本 3.50 美元,标准版低至 0.84 美元。支持 97 种语言单次对话内切换、近实时视觉输入、128K 上下文,输出音频带 SynthID 水印。
Grok 4.7
xAI
Grok 4.7 是 xAI 于 2026-09-12 发布的旗舰模型,参数规模 2.1 万亿(较 Grok 4.6 的 1.5 万亿 +40%),马斯克称其工程与科学推理优于所有同类模型、token 效率更高,并以 SpaceX 工程数据补充训练。⚠️ 截至 2026-09-16,xAI 未公开 4.7 的官方 model card、上下文窗口、基准套件与 API 定价,文档库最新条目仍为 grok-4.6,本卡参数与能力口径待核实。
DeepSeek V4.1-Flash
深度求索
DeepSeek V4.1-Flash 是深度求索 2026-09-10 发布的 552B MoE 模型,采用 Causal Encoder–Decoder 非对称架构(输入激活 8B / 输出激活 16B),支持 1M 上下文与原生视觉理解,权重以 MIT 许可开源。API 闲时 $0.15/$0.60 每百万 token,并自 2026-09-14 起接管全部 deepseek-v4-pro 请求。
SWE-2
Cognition
Cognition 于 2026 年 9 月 10 日发布的编程模型 SWE-2,基于月之暗面 Kimi K3(2.8T 参数)后训练而来。官方称 FrontierCode 1.1 Main 得 50.0%,距 Claude Fable 5.1 仅 1 分而成本低 64%;Terminal-Bench 2.1 达 92.8%,但 Terminal-Bench 4 仅 27.3%。仅在 Devin 产品线内提供,无开源权重、无独立 API。
GPT-6 Astra
OpenAI
OpenAI 2026 年 9 月 3 日发布的新旗舰 GPT-6 Astra,GPT-5.6 Sol 的继任者,1.05M 上下文,主打 computer use 与长程 Agent 任务,OSWorld 2.0 达 72.6%,定价 $10/$50 每百万 token。
Gemini 3.8 Flash / Flash Cyber
Google 2026 年 9 月 2 日发布的 Gemini 3.8 Flash 与安全特化版 Flash Cyber,官方称「迄今最强推理与编程模型」,促销价 $0.75/$3.75 与 3.7 Flash 持平,Flash Cyber 面向 Fairwind 计划受信防御方。
Claude Fable 5.1 / Mythos 5.1
Anthropic
Anthropic 2026 年 9 月 1 日发布的 Claude Fable 5.1,定位高要求推理与长程 agentic 工作,1M 上下文,$10/$50 定价不变但缓存读降至 $0.25,配套受邀制 Mythos 5.1(Project Glasswing)。
GLM-5.3
智谱 AI
智谱 AI 2026 年 8 月 14 日发布的 GLM-5.3,总参数 7430 亿,编程与智能体能力逼近 Claude Fable 5,是当前排名最高的开源模型,完整权重将于约两周后开源、API 即将上线。
Gemini 3.7 Flash
Google 2026 年 8 月发布的 agent-first Flash 模型,发布价 $0.75/$3.75 每百万 token(约为 3.6 Flash 一半),1M 上下文,编程与 Agent 基准大幅跳升,驱动 Gemini Spark 常驻 Agent。
Grok 4.6
xAI
xAI 2026 年 8 月发布的 Grok 4.6,经 agentic RL 训练,AA 智能指数 61 追平 GPT-5.6 Sol,定价维持 $2/$6。配套 Grok Bot——拥有独立电脑、可端到端自主完成任务的 AI 队友。
Gemini 3.6 Flash
Google 于 2026 年 7 月 21 日发布的稳定版 Flash 模型,1M 上下文、65K 输出,定价 $1.50/$7.50 每百万 token,定位高吞吐多模态场景,原生支持函数调用与流式。
Kimi K3
月之暗面
Kimi 是月之暗面(Moonshot AI)的旗舰模型系列。最新 Kimi K3 为 2.8T 开源权重、1M 上下文,Arena.ai 编程榜全球第一。本文评测其编程能力、定价与自托管价值,帮你判断是否值得用。
GPT-5.6(Sol / Terra / Luna)
OpenAI
OpenAI 2026 年 7 月 9 日全量 GA 的 GPT-5.6 家族,分 Sol/Terra/Luna 三档,1.1M 上下文,Terminal-Bench 2.1 最高 91.9%,全平台覆盖。
Grok 4.5
xAI
xAI 2026 年 7 月 8 日发布的 Grok 4.5,1.5T MoE、最高 500K 上下文,用 Cursor 会话数据联合训练。定价 $2/$6 约为同级一半,主打编程性价比。
Claude Sonnet 5
Anthropic
Anthropic 2026 年 6 月 30 日发布的 Claude Sonnet 5,1M 上下文,SWE-bench Verified 85.2%,现为 claude.ai 默认模型,促销期定价 $2/$10。
DeepSeek V4(V4-Pro / V4-Flash)
深度求索
DeepSeek 2026 年 6 月 27 日发布的 V4(代号 DSpark),分 Pro/Flash 两档。⚠️ 2026-09-14 起 V4-Pro 与 V4-Flash 均已退役,请求统一路由至 V4.1-Flash(552B、MIT 开源、闲时 $0.15/$0.60);本卡定价与双档结构已失效,新项目请改用 V4.1-Flash。
GLM-5.2
智谱 AI
智谱 AI GLM-5.2 旗舰大模型(2026 年发布),国产编程与 Agent 工具调用能力第一梯队,国内直连零延迟,输入 ¥2/M 价格友好,提供慷慨免费 API 额度与开源权重,国内开发者主力选项。
Kimi K2.7 Code
月之暗面
月之暗面 2026 年 6 月开源的编程专用模型:1.1 万亿参数 MoE、256K 上下文、Token 成本较上代降 30%,编程基准官方称对标 Claude Sonnet 4。官方 API ¥8/¥32 每百万 token,配套 Kimi Code CLI 开箱即用,是国产编程模型第一梯队。
小米 MiMo(编程模型)
小米
小米 2026 年 6 月 11 日随 MiMo Code Agent 开源的自研编程模型:SWE-bench Pro 62%、Terminal Bench 2 73% 双超 Claude Code,内置多模态与记忆系统,是国产 Agent 第一次在权威基准上正面超越 Anthropic 的核心武器。
Qwen-Max(qwen3-max)
阿里巴巴
Qwen-Max 是阿里百炼的闭源旗舰档(当前对应 qwen3-max 正式版,等同快照 qwen3-max-2026-01-23),智能体编程与工具调用专项升级。输入 ¥2.4/百万 token(缓存命中 ¥0.48),输出 ¥9.6,国内直连支付宝计费,是国产旗舰里 Agent 场景的稳妥选择。
TranslateGemma
谷歌
Google Translate 团队基于 Gemma 3 训练的开源专用翻译模型家族,2026-01-15 发布,提供 4B / 12B / 27B 三个尺寸,WMT24++ 评测覆盖 55 种语言,支持文本与「图片中的文字」两种输入,可在端侧完全离线运行。12B 版本在 WMT24++ 的 MetricX 上超过了参数量两倍于它的 Gemma 3 27B 基线。输入上下文约 2000 token,权重按 Gemma 条款开放。
Claude Opus 4.5
Anthropic
Anthropic 2025 年 11 月发布的旗舰模型,专为编程/agent/computer use 优化,SWE-bench Verified 发布即 SOTA,新增 effort 参数大幅降本。
GPT-5.1-Codex-Max
OpenAI
OpenAI 2025 年 11 月发布的专用 agentic 编码模型,首创 compaction 跨窗口机制可连续工作 24+ 小时,SWE-bench Verified 77.9%,首个原生支持 Windows。
Gemini 3 Pro
Google 2025 年 11 月发布的旗舰多模态模型,1M 上下文 + LMArena 登顶 + vibe coding 标杆,同步推出 agent 开发平台 Antigravity。
Kimi K2 Thinking
月之暗面
月之暗面 2025 年 11 月开源的 agent 推理模型,1T/32B MoE,可连续 200-300 次工具调用,原生 INT4 提速 2x,BrowseComp 超过 GPT-5 High。
MiniMax M2
MiniMax
MiniMax 2025 年 10 月开源的 agent/编程专用模型,230B/10B MoE,MIT 许可,约 Claude Sonnet 8% 价格 + 2x 速度,性价比之王。
Kimi K2
月之暗面
月之暗面 Kimi K2 超长文本旗舰模型,单次可吞下数百万字上下文,中文长文档分析、合同 / 论文 / 财报理解能力国产最强之一,网页版完全免费可用,API 提供慷慨免费额度,长文场景首选。
Qwen 3
阿里巴巴
阿里通义千问 Qwen 3 系列开源大模型,0.5B 至 235B 全尺寸覆盖,端侧小模型性能业界领先,多语言(119 种)能力广泛,国内可直连 + 慷慨免费 API 额度,适合从边缘设备到云端 GPU 的全栈部署。
GPT-5
OpenAI
GPT-5 深度评测:OpenAI 推理旗舰模型,400K 超长上下文,128K 输出窗口,多模态原生支持。数学/科学/代码全面,API 价格低于 Sonnet 4。含编程能力对比、国内可用性、Cursor 实测反馈。
Llama 4
Meta
Meta Llama 4 开源旗舰大模型,完全免费可商用 + 多模态原生支持,HuggingFace 社区生态与微调工具链最完整,权重开放支持 LoRA / 全参微调与私有化部署,适合学术研究、企业自托管与合规敏感场景。
Qwen3-Coder
阿里巴巴
阿里 2025 年 7 月开源的 agentic 编码旗舰,480B/35B MoE,Apache 2.0,256K 上下文(可扩 1M),SWE-bench 开源 SOTA,配套 Qwen Code CLI。
Doubao 1.5 Pro
字节跳动
字节跳动豆包(Doubao)1.5 Pro 旗舰模型,256K 超长上下文 + 多模态原生支持,火山引擎稳定服务无境外延迟,输入 ¥0.8/M 极低价,深度集成飞书 / 抖音 / 扣子(Coze)生态,国内合规场景首选。
Gemini 2.5 Flash
Google Gemini 2.5 Flash 极致性价比模型,输入 $0.075/M 全网最低之一,100 万 token 超长上下文 + 原生多模态(图像 / 音频 / 视频),适合高吞吐 RAG、批量文档分析与成本敏感型生产场景。
Claude Haiku 4
Anthropic
Anthropic Claude Haiku 4 轻量快速模型,价格为 Sonnet 4 的 1/3、推理速度约 3 倍,工具调用与指令跟随保持 Claude 家族水准,适合代码补全、IDE 实时辅助、批量处理与高并发 Agent 场景。
Claude Opus 4
Anthropic
Anthropic Claude Opus 4 旗舰推理模型,复杂代码任务、长文写作、多步规划与 Agent 链路能力业界领先,Output $75/M 为 Sonnet 4 的 5 倍,适合高价值难题、深度研究与企业级关键任务。
Claude Sonnet 4
Anthropic
Claude Sonnet 4 深度评测:Anthropic 编程旗舰模型,200K 上下文窗口,SWE-bench 72.7%。在 Cursor / Claude Code 中编程表现最佳,64K 输出窗口,artifacts 原生支持。含价格、API 兼容、国内可用性分析。
Gemini 2.5 Pro
Google Gemini 2.5 Pro 旗舰多模态模型,100 万 token 业界最长上下文,图像 / 音频 / 视频 / 代码原生混合推理,Vertex AI 企业级 SLA 集成,Flash 版本提供 1/16 价格兜底。
Google Gemini Robotics
Google DeepMind
Google DeepMind 基于 Gemini 2.0 的机器人多模态模型家族,能把自然语言指令和摄像头画面直接转成机器人动作;2026 年进一步推出 On-Device 本机推理版本,让模型跑在机器人自己身上。
NVIDIA Isaac GR00T
NVIDIA
NVIDIA 的开放人形机器人基础模型家族(GR00T N1 / N1.5 / N2),配 Cosmos 世界模型与 Newton 物理引擎,主打跨本体、可定制、可规模化训练,是 2026 年具身智能最核心的开放底座之一。
DeepSeek-R1
深度求索
深度求索 DeepSeek-R1 开源推理大模型,完整暴露思维链(Chain of Thought)推理过程,数学与代码推理能力对标 GPT-5/o3,API 输入仅 ¥1/M 是 OpenAI 同级的 1/30,国内可直连且权重开放,支持私有部署。
DeepSeek-V3
深度求索
深度求索 DeepSeek-V3 开源 MoE 大模型,671B 总参数 / 37B 激活,编程与数学逼近 GPT-4o 第一梯队,API 输入 ¥1/M 全网最低,权重 MIT 协议开放,国内直连无延迟,支持私有化部署。
GPT-4o
OpenAI
OpenAI GPT-4o 多模态主力模型,文本 / 图像 / 语音原生统一推理,响应速度业界领先,开发者生态最成熟(Function Calling、Assistants API、Structured Outputs 一线适配),适合通用多模态应用与高吞吐生产部署。