Gemini 3.8 – 谷歌推出的推理与编码模型

Gemini 3.8 – 谷歌推出的推理与编码模型

Ai热点前沿
Ai热点前沿09-03 01:50

2026-09-03 09:50

导语:15%价格对标Claude Opus 5,Agent循环机制。Gemini 3.8是什么 Gemini 3.8 是 Go

Gemini 3.8是什么

Gemini 3.8 是 Google 推出的推理与编码模型,包含 Flash 和 Flash Cyber 两个版本。Gemini 3.8 Flash 在保持与前代相同速度和低价的基础上,大幅提升软件工程、Agent 任务及多步推理能力,在代码、金融、法律等基准测试中接近甚至超越更大参数的前沿模型。Gemini 3.8 Flash Cyber 是专为网络安全打造的版本,具备顶尖漏洞发现与自动补丁修复能力,仅通过 Fairwind Program 向认证安全防御人员开放。

Gemini 3.8

Gemini 3.8的主要功能

  • 长周期软件工程:自主完成复杂工程问题的端到端解决,在 DeepSWE 等基准中表现接近甚至超越更大参数的前沿模型。
  • 自主 Agent 任务:支持复杂多步骤的 Agent 工作流,可执行迭代式工具调用与推理,适用于终端编码、计算机操作等场景。
  • 专业领域推理:在金融分析、法律工作流及跨学科专家推理中展现出企业级可靠性。
  • 网络安全攻防:Flash Cyber 版本专注于自主漏洞发现与自动化补丁修复,在 CyberGym 和 CWE-Bench 等行业基准中达到前沿水平。
  • 原生多模态:支持文本、代码、图像、视频等多种模态输入,可生成 3D 可视化、游戏、交互式应用等富媒体内容。

Gemini 3.8的技术原理

  • 长期运行的 Agent 循环机制:Gemini 3.8 引入长期运行的 Agent 循环(long-running agentic loops),该机制使模型能在任务执行过程中递归地评估和精炼自身输出。与单次前向传播不同,模型会在复杂任务中持续迭代——执行额外的推理步骤、反复调用外部工具、根据中间结果动态调整策略,在多步骤推理和代码生成任务中实现更深度的执行和更高的准确率。
  • 动态计算投入与推理强度调节:模型采用”投入更多计算量”的设计哲学,在复杂任务上展现出更高的执行勤勉度(greater diligence)。模型会根据任务难度自动分配更多推理资源,在更高推理强度(higher effort levels)下可能消耗更多 Token 以最大化性能;同时,开发者可选择较低的推理强度级别来减少 Token 开销,在性能与成本之间灵活权衡。
  • 网络安全领域的深度专项训练:Gemini 3.8 Flash 和 Flash Cyber 共享同一套底层基础智能,显著的代码与推理能力提升部分源于在网络安全这一高要求领域进行的严格训练。通过在漏洞发现、补丁修复等任务上的深度优化,模型学会了识别和修复跨 20 种编程语言的复杂代码漏洞,内化防御者优先的安全思维。

如何使用Gemini 3.8

  • 开发者:通过 Google AI Studio、Gemini API 或 Android Studio 调用 3.8 Flash,也可在 Google Antigravity 中探索 Agent 优先的工作流,或在 Stitch 中生成 UI。
  • 企业用户:直接在 Gemini Enterprise 平台中接入 3.8 Flash,用于构建企业级智能应用。
  • 普通消费者:订阅 Google AI Pro 或 Ultra 后,可在 Gemini App、Google Search 的 AI Mode 以及 Google Sheets 中使用 3.8 Flash。
  • 安全防御人员:通过 Fairwind Program 提交申请,获得认证后可优先访问 3.8 Flash Cyber,用于漏洞发现与自动化补丁修复。

Gemini 3.8的核心优势

  • 极致性价比:用 Flash 系列的低价提供接近甚至超越 Claude Opus 5、GPT-5.6 等更大参数前沿模型的推理与代码能力。
  • 长周期软件工程:在 DeepSWE v1.1 等长周期软件工程基准中,能够自主端到端解决复杂工程问题,性能位居行业前列。
  • 企业级专业推理:在金融分析、法律工作流及跨学科专家推理等关键领域展现出支撑自主任务的可靠性。
  • 动态计算调节:支持根据任务复杂度灵活调整推理强度,既能在高难度任务上投入更多计算资源以最大化性能,也能在效率优先场景下降低 Token 消耗。
  • 网络安全专精:Flash Cyber 版本在漏洞发现和自动化补丁修复上达到前沿水平,且成本远低于同类大参数模型。
  • 原生多模态与 Agent 能力:基于长期运行的 Agent 循环机制,支持文本、代码、图像、视频等多模态输入,可自主迭代完成复杂多步骤任务。

Gemini 3.8的项目地址

  • 项目官网:https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Gemini 3.8的同类竞品对比

对比维度 Gemini 3.8 Flash Claude Opus 5
产品定位 高智能”主力模型”,兼顾性能与成本 旗舰级深度推理模型,追求极致智能
输入价格 $0.75 / 百万 Token $5.00 / 百万 Token
输出价格 $3.75 / 百万 Token $25.00 / 百万 Token
DeepSWE v1.1(长周期软件工程) 73.7% 74.0%
HLE-Verified(跨学科专家推理) 54.9% 54.4%
Harvey 法律 Agent(复杂法律工作流) 10.0% 6.7%
Vals Finance Agent(金融分析) 61.4% 58.6%
推理速度 Flash 级别,高速响应 相对较慢,侧重深度
多模态能力 原生支持文本、代码、图像、视频 以文本推理为主
核心优势 极致性价比 + 自主 Agent 能力 超长上下文 + 深度逻辑推理

Gemini 3.8的应用场景

  • 自主软件开发:模型支持端到端完成复杂代码重构、Bug 修复与功能开发,支持长周期软件工程任务。
  • 金融量化分析:自动化解析财报与市场数据,生成投资研究报告、风险评估及合规建议。
  • 法律文档审查:快速分析合同条款、判例与法规,辅助律师完成尽职调查与合规审查。
  • 网络安全防御:自动扫描跨语言代码库漏洞并生成修复补丁,帮助安全团队快速响应威胁。
  • 多模态智能应用:基于自然语言生成 3D 交互游戏、数据可视化应用或富媒体内容。

来源:AI工具集

#AI工具

免责声明:含第三方意见,不构成财务建议

分享至
X
Telegram
WeChat
QQ
Link
推荐阅读

Hy4 preview 轻量版 – 腾讯混元开源的Hy4量化压缩模型

1 天前
Hy4 preview 轻量版 – 腾讯混元开源的Hy4量化压缩模型

Claude Fable 5.1 – Anthropic 推出的最新旗舰大模型

1 天前
Claude Fable 5.1 – Anthropic 推出的最新旗舰大模型

开源版Retool来了,60+组件拖拽搭后台

15 天前
开源版Retool来了,60+组件拖拽搭后台

Claude Opus 5来了:半价逼近Fable 5

07-25
Claude Opus 5来了:半价逼近Fable 5

腾讯开源260个真实任务,考AI打工能力

07-25
腾讯开源260个真实任务,考AI打工能力

美团开源AI考场:813个Minecraft任务

07-25
美团开源AI考场:813个Minecraft任务

微软图像模型进PPT,GPU成本降84%

07-24
微软图像模型进PPT,GPU成本降84%