据谷歌官方博客,谷歌为Gemini API上线Agentic Video Understanding功能。该功能让模型自主决定视频分析策略:传统模式按1 FPS固定抽帧后一次性处理,新模式则沿时间轴动态定位片段,并根据问题选择画面、音频或转录文本,快速动作时自动提高帧率重检。谷歌自测显示,Gemini 3.7 Flash开启后Token消耗最高下降88%,分析成本最高下降66%,准确率相对提升最高约7%;
可定位不到1秒的瞬间或数小时视频中的细节。该技术将开发者此前需手动搭建的“先定位、再精看”流程内置至Gemini内部。目前Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite均支持,上传视频和YouTube视频均可使用,不另收功能费,后续将接入Gemini App和YouTube的Ask YouTube。
免责声明:含第三方意见,不构成财务建议
Roku OS更新推出Roku Labs实验应用中心,语音助手新增天气问答
3 天前
Flop Labs 构建 AI 代理算力交易市场,FLOP 代币用于支付 GPU 算力
18 天前
Caterpillar将自动化采矿经验用于AI部署,推出Cat AI语音助手并计划五年投入1亿美元培训员工
21 天前
Perplexity 免费赠送策略见效:印度用户留存超五倍,订阅收入反增60%
08-19
Neko Health 将于9月24日在纽约开设首家美国办公室,已有2.5万人排队等候
08-19
Einride 采购 500 辆特斯拉 Semi,通过 Saga AI 平台管理车队
08-19
Peacock 全系涨价 4 美元,同步推出 AI 驱动垂直视频与实时直播裁剪功能
08-19






