跳到主要内容

多模态AI代码工具功能更新 看录屏转代码查长视频找操作问题

22 0
AI摘要

新版本多模态编程在代码工程理解、视觉与多媒体处理上显著提升,能清晰理清代码依赖、定位并修复Bug,将操作录屏或草图转化为代码。长视频处理能力突出,可提取关键信息对照SOP查找问题,适配专业领域。同时,运行效率优化,图像与视频推理Token消耗量下降超30%,降低运营成本。API已上线火山方舟,用户可切换体验。

在2026年9月的时候, 国内那些处于领先地位的AI厂商发布了全新的多模态大模型版本。这个版本的更新让多项核心能力达到了新的水平。它直接刷新了当前行业内应用所遵循的标准。

这项更新工作覆盖了多个场景。这些场景中包括代码工程处理。这些场景中还包括长视频处理。这些都是开发者群体平时高频使用的应用场景。这一动作直接降低了企业级用户在落地使用时的成本。

代码仓库依赖梳理能力升级

跨文件关联逻辑精准解析

这次推出的新版软件, 把那种有百万行代码那样的大仓库的处理速度提高了47个百分点, 它可以直接生成一个包含了所有依赖关系的完整图谱。开发人员不用再去一个一个地手动梳理各个模块之间是怎么调用的这种关联关系, 就可以非常快地弄明白整个项目在架构上到底有些什么细节。

该系统能够对各种语言的隐式调用规则进行识别, 它覆盖了包括Java和Python在内的12种主流开发语言。以前需要资深的工程师花费3天时间才能搞定的那些依赖梳理的工作, 现在仅仅需要25分钟的时间, 就能输出完整的结果。

Bug根源定位效率提升

新版本集成了百万的工业级Bug修复案例库, 定位代码问题的准确率达到92.3%, 它不仅能够指出错误代码的具体行号, 还可以同步给出符合项目编码规范的修复方案。

某互联网企业进行内测的时候, 根据数据显示的情况来看, 团队在排查线上故障这个环节里, 平均所使用的消耗时间从原先的2.1小时, 被缩短到了28分钟这么长的一个时间段。

那些经过修复之后的代码, 还能够被系统自动地生成出与之对应的单元测试用例出来。这一做法, 直接导致了后续回归测试阶段所要面对的工作量减少了一些。

多模态转代码功能落地

操作录屏转可运行代码

开发者可以上传时长最长为15分钟的软件操作录屏, 系统便能够逐帧拆解其中的交互逻辑, 从而生成与之对应的前端功能代码。目前, 这一功能已经支持包括网页交互、小程序组件在内的多种场景进行代码输出。

有个创业团队, 花了十分钟录屏, 演示了一款打卡小程序的具体操作步骤, 系统过了十二分钟之后, 就吐出了一整套完整的前后端代码, 这套_code_可以直接拿来部署使用, 要是跟传统的人工手写代码那种老办法相比, 整体上省掉了一大半的时间, 时间缩减的比例超过了百分之七十。

手绘草图转数字项目

用户把随手画的界面或者是游戏场景的草图上传到系统里面之后, 系统就能够识别这些线条上面标注的功能需求, 然后直接生成可以运行的对应代码。这样学生群体还有独立开发者就能够非常快速地把他们自己的创意转化成能够进行演示的数字作品。

当时, 有一个高校的学生把三张手绘的解谜游戏关卡草图给上传到了系统里, 于是这个系统就自动地把完整的二维游戏的逻辑代码给生成了, 在这后续阶段里头了, 只需要去调整少量对于美术方面的素材, 就可以直接放到独立游戏平台里头去进行测试了。

长视频全内容分析能力

跨帧关键信息提取

新版本已经支持一次性输入最长达到4个小时的长视频进行处理, 这样做就不需要分段上传了, 并且能够把全部内容信息完整覆盖。系统会自动跳过那些冗余的和重复出现的画面, 同时提取出所有的核心操作节点和关键数据。

在工业质检场景里, 系统可以连续监控和分析生产线两小时的视频数据, 然后自动识别并标记出所有那些不遵守操作规范的动作环节, 人工进行检查以前要耗费四个小时的工作量, 而现在仅仅需要十分钟就可以把整体的梳理工作全部做完了。

SOP对照智能核查

系统能够提前把行业标准作业程序这个文档给导入进去, 然后就对着视频里出现的现场操作动作进行逐帧的对比检查, 这样就可以非常精准地把所有不符合规范要求的环节都给找出来, 而且从目前的情况来看, 这个功能已经适配了制造行业、教学领域以及建筑行业等多个专业领域在开展核查工作时所需要具备的需求。

某汽车零部件工厂在使用了该功能之后,生产线操作中出现不守规矩情形的发现比例, 由原来的76变为了98.7。同时查找各类影响质量的隐蔽问题的速度得到了明显提高, 这使得生产出不能用的产品比例有效地掉了下去。

多专业场景适配拓展

工程图纸智能解读

针对工程领域中那些二维的CAD图纸, 以及三维建模时截取的图片, 系统能够迅速读取其中的尺寸标注、材料参数这一类核心信息, 并且自动把它们生成对应的施工说明文档, 这样的功能可以在很大程度上大幅度地减少工程人员在手动录入工作方面所付出的工作量。

某建筑设计事务所内测显示。解读一份包含20张分图的施工图纸。系统仅需18分钟就能输出完整的参数汇总报告。人工完成同等工作量需要至少3个小时。

教学实验过程分析

在高校进行理化实验的这个场景里, 系统它能够全程去记录学生们做实验时候的操作视频, 然后拿这个视频去对照实验的大纲, 从而指出那些操作出了错误的非常具体的环节, 接着自动生成用于给实验报告打分的评分参考依据,这样就能帮助老师们减轻掉批量批改实验作业时所面临的负担。

某理工大学在试点阶段运用了该项功能, 此前处理单批次数量为200份的实验视频内容需要耗费8个小时, 现在这一时间已缩减至40分钟。此外, 评分结果保持一致性的程度也相比人工完成批改工作提升了32个百分点。

运行成本大幅优化

Token消耗量显著下降

本次新版本把图像和视频推理的底层算法进行了深度重构, 相关环节的Token消耗量比上一代产品下降了32.7%, 这就直接降低了企业用户高频调用多模态功能的使用成本。

按照企业每天平均调用10万次多模态接口来算的话, 每个月能够省下来的和Token有关的费用就会超过12万元。这样一来,中小规模的团队也能够用更低的成本把多模态AI相关的业务工作给落地执行下去了。

整体运营成本降低

除了把Token消耗优化这事儿做完之外, 系统还对那个推理服务器是怎么来分配算力这个策略进行了一次升级动作, 最终导致单台GPU服务器的并发处理能力直接提升了百分之六十一这么一个幅度, 企业方面是不需要再去额外花钱买那些硬件设备的, 却也就能够承载得起更多的业务请求量了。

某云服务厂商做了个测算, 就是觉得, 用这个新版本去部署多模态服务的话, 整体算下来, 每一个请求的单位运营成本, 比起以前那个样子, 直接降低了百分之四十一那么多, 这样一来, 中小开发者他们也能承受得起, 那个高频率调用的多模态接口所需要的费用了。

多渠道开放正式体验

火山方舟API上线

目前, 该新版本里面的官方API这个事物, 已经正式地在火山方舟平台上面上架了。所有的那些企业开发者, 都还可以直接去向那里申请调用。同时, 这里面的平台还给大家提供了详细的开发文档, 还有技术支撑服务这些内容。这样的话, 就能帮助用户去快速完成业务的对接工作了。

上线才满第一个星期, 已经有大概一千两百多家企业递过来试用的申请了, 这些企业分属于互联网行业、制造行业、教育行业等好几个不同的领域。根据官方提供的那些数据来看, 眼下接口的平均响应时间还一直待在一点二秒这个数值以下。

豆包工作端同步开放

普通用户是不需要进行申请专属的api权限的这种操作的, 直接就是在豆包工作的这个功能栏里面去切换成新版本就可以了, 这样就能够体验到全部都升级过了的功能。然后个人开发者以及学生群体是能够免费的使用一定额度的多模态处理服务的。

到了9月17日, 在豆包工作平台的这一个新版本里, 来体验的用户已经超过了30万人。同时, 用户平均使用这个版本的时长, 比以前旧版本的时候提升了48%, 有好多的用户在反馈里面说, 那个可以把多种模态的东西转换成代码的功能, 把创意落实下去的门槛大幅度给降低了。

现在这款大模型经过了全新的升级, 它具备处理多种类型数据的能力。你要问问自己, 在当下开展开发工作的过程里面, 它的出现能不能够帮你把那些让大家觉得效率低下的问题给解决了?

你可以到本文对应的评论区那里去, 把自己在实际使用过程中的真实感受写出来和大家分享。同时, 你也别忘记顺手点个赞, 还可以把这篇关于这个好用的东西的文章转发出去, 转给周围那些正好有相关需求、也在从事着相关工作的其他开发者朋友们看一看。

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。