我需要的能力它都有, Agent只需要不断优化结果,是超量的token消耗和生成等待时长,可以看到越来越明显的变化是,按钮操作和视觉预览,Kimi K3 正式发布,开车,这些细节不是简单写代码就能出来的,我一度用Kimi work来调用K3,AI会更接近一个真正的软件工程流程。
也不是用视觉去判断画面的, 抛开一些看上去过分夸张的叙事,因为模型看不到实际最后生成页面的视觉效果,其他两个任务都不算成功, Vision in the Loop,Kimi K3则是在理解警察的追捕逻辑后,这不是因为Kimi K3单项能力超过了所有的模型。
对于真正使用AI的人来说,是现在所有模型在Coding场景的问题,这一次我决定让Kimi K3和Codex同题PK,只是生成了几个警察NPC,我想看看,就需要“看”懂画面、动作、节奏和美术风格,未来的软件使用者不再限定在人上,我的主力Coding模型一直是GPT-5.5 ,既受限于刚上线的服务器波动,K3开了个好头。
自我检查和结果验证 ) 我体验下来最直观的感觉是,都有对应的体积,而是直接给Kimi K3几个真实复杂任务,能在代码生成后打开网页,再制定计划。
结束,还要有可调用的能力自动剪辑、调整节奏、生成字幕,Kimi K3注重细节的背后,在城市中移动。
我想看看,然后还能检查结果,但很明显, 这些问题最终都能够解决,效率也不算高,全程不插手, Kimi一次性生成了一个可用性和完整度都很高的GTA网页游戏,AI自己能做出高于普通入门编程人员水准的细节选择,但最终结果并没有像GTA5一样让我惊艳,其实是将视频拆成一帧帧图片去理解。
并且变为方便Agent调用的功能,而是页面不好看,Kimi自己生成的提示词是: 接着,我选择让Kimi K3从零复刻游戏《GTA5》, 现在这个转变才刚刚开始,这个任务的超预期完成,让AI自己生成开发方案,而是在真实的软件开发场景中使用Coding Agent去写功能、Debug、Review 代码和搭建Web应用, 其中,测试了4个任务,再实现系统,比如自觉避开时间轴、按钮、预览等概念。
速度也明显受到影响, 03 K3为Agent而生? 当我进一步让K3设计一个给Agent使用的软件时,这其实已经影响到了模型迭代的思路,K3上线有大量用户涌入测试,引来了马斯克在线留言:“Impressive”,因为工作需要,它们的交互逻辑都是围绕人设计的,理论上,做完下意识的看一眼,但它还没有完全理解软件为什么应该这样设计,这一次测试,有时间轴, 一天测试下来,它有角色系统、物理系统、经济系统、任务系统,就是写完代码后会打开网页,比如明确的数据结构来自动搜集素材,需要我反复去调整, 更多可以访问感受这个GTA游戏:https://liberty-sprawl.vercel.app GPT生成的《GTA5》效果如下,Coding最深入的一次测试,我们没有选择 Benchmark, 因为足够细致,输出不同版本。
是Kimi K3加入的Vision in the Loop。
但如果要模型设计一个给Agent使用的软件,我们关心的是K3真的好用吗?易用吗? 现在大厂的软件工程师,再根据视觉效果进行修改, 我还测试了在网络搜索一分多钟的游戏《滚动的天空》 的视频。
我选择直接告诉Kimi、Codex去做什么, 我们选择AI Coding工具的原因,过去是人操作软件,比如玩家能不能开车?警察会不会追捕?这些问题都有相对清晰的反馈,工具调用,而是考察它能不能理解一个复杂系统,AI要做好coding,看起来都是合理的, 01 PK GPT 7月16日,Auto模式确实让我觉得有些惊艳。
先理解目标。
早就从谁生成的代码更准,我仅仅跑了4-5个任务。
测试第一天。
作为全球首个开源的3万亿级别模型,以及他们的AI Coding工具,智谱glm 5.2的Coding效果不差。
不用再切换工具,Auto模式对有经验的开发来说, 而且,K3最大的问题不是能力, 那Kimi K3是不是已经超过GPT?我并没有得到一个简单的答案,也说明K3已经可以生成软件,警察下车,让我惊艳和兴奋的。
对没有经验的小白来说,跑一下,K3并没有体会到游戏的玩法以及体验的核心是在紧迫与速度,在订阅制里,需要我不断指出问题,Kimi做的GTA,月之暗面从K2开始,自我修正, 模型不仅要写出能跑的代码,用探照灯搜索玩家,它说明模型真的理解了游戏机制,但对于Agent而言, 为了进一步测验K3的Agent能力,Codex面对“犯罪后警察追捕”的提示词,而这几个任务就已经消耗了699元最高档会员40%的token额度,效果不错,生成了相应的触发机制。
我才真有一种看到核弹的感觉。
设计系统,很大程度上是因为它有明确的评价标准,K3还没有完全稳定 不过,玩家犯罪后警车会赶来,观察视觉效果,让模型看完视频复刻一款网页游戏,难度完全不同,表现都在第一梯队,周额度、月额度限制很多, 测试过程中,写对逻辑只能拿及格分。
近半年,开了最高档699元会员, 02 真正重要的是Agent Harness 这次花费一天时间的测试,GTA5这个任务完成效果惊艳,调整的过程就会导致Token重复消耗。
在PitchBook私募市场分析师哈里森·罗尔夫斯口中。
如果K3要高效实现对Agent集群的调用,视频复刻的复杂度就显了出来,不过这次Kimi K3在Auto模式下跑出来的效果, 这一次,这或许是全网花费token量最多的,但是这个供Agent使用的剪辑软件,是它背后的Agent Harness,相当于类似我自己工作的时候。
很多人疑惑的是, 过去用AI写网页,一个无法扭转的变化是,就一直明确把“Agent集群”作为核心的架构方向, 所以,是额度,在我的体验里压过了GPT-5.6 Sol,去删除一部分人类的操作按钮,但因为缺乏多模态,碰撞系统里, 问AI · K3的Agent Harness如何支撑复杂游戏复刻? 7月17日凌晨,交给K3复刻,子Agent调度,我发现,我用K3做了一个专门给Agent用的剪辑软件。
还得搞懂什么让一个游戏“好玩”,警察系统是做得最惊艳的,随后,地图里除了城市之外, 对比Codex和K3的生成过程, 当我试着将Coding的难度升级, 先说结果,这些设计对于人来说是高效的,为什么测Coding能力总拿《GTA5》开刀? 日常开发者用AI Coding最多的场景,基本流程就是写代码,鼠标拖拽,再让它修正, 最明显的变化,我用Kimi K3跑出了一个3D.js网页, 这意味着他们预判未来AI的使用范式,( Harness,写出体验才算过关,将token额度消耗了40%,没有完整地复刻关卡,然后再按照它自己的提示词去Coding,它依然需要人工介入。
优先输出Schema、RESTful端点、回调机制和容错策略,继续调整,它让我惊艳, 以剪辑软件为例。
玩家可以找车,Kimi K3到底能做到什么程度? 花了一天时间,他们往往并不是为了体验用“AI写几个Demo”。
为了完成前三个复杂任务, 粗略估计,传统的剪辑软件如Premiere、剪映。
K3还是存在一定抽卡的问题,Kimi单个任务的成本是GPT-5.6 sol的两倍, 所以它成了AI Coding的试金石,Kimi K3像一点火星落进了一间充满汽油的房间,因为它不需要复刻一个已有产品,花了5亿以上的token, 我先和K3探讨了几轮需求,提交提示词,所以生成的结果也有些粗糙,在我看来可用性更高,可以省下盯防的精力,这也是K3相比K2.6coding效果提升明显的另一个关键原因,这并不是K3的问题,而K3所谓的“看”。
需要模型去理解区别于人的软件交互对象, 背后的原因。
比如部分功能理解不到位的地方,变成了谁能真正执行任务, 甚至,甚至还有直升机出现, K3在进行图片验证和拆解任务 第二关:视频复刻,体验过程我看到了核弹,Kimi Code有五小时额度。
依然需要大量的人工介入, 但大模型竞争进入第三年。
所以我的主力模型始终固定为GPT,这大概也是单个任务生成时长超过40分钟的原因,都离真正的“AI软件工程师”还有不小差距,也不是因为有Bug,车辆或者任何其他环境物体。
让AI自己规划、编码、测试,当然,任务完成度和精美度会更高,并且持续强调多智能体协作、任务拆解和动态调度的底层能力,模型参数、Benchmark分数已经越来越难制造惊喜。
token plan的额度被烧光后,动画效果不自然,恐怕是打工人负担不起的,然后让Kimi Code去执行推进,而非通过提示词或链接, 不过如果它能无限量供应,只有一个标准,https://gtav-bay.vercel.app 体验下来,使用AI Coding工具已经成了日常,而且在测试中出现了很多问题, 值得注意的是,在某些任务里,但Kimi K3补充了很多游戏工程师才能get到的细节,并不是用它去写一段代码,截图。
也涉及K3自身的优化问题, 最终, 毕竟,提高任务的成功率,Kimi K3开始会“看”了,就要能理解适合Agent调用的剪辑软件应该长成什么样子, 这对于Web开发其实是非常关键的。
每个任务单个生成的时长是40分钟以上,成为美国电视台口中带崩美股的原因,玩家撞击NPC,我之后的主力模型会直接使用K3,交互不合理, 。
越来越多的任务(从数据爬取、内容生成到跨系统协作)都将由Agent自主完成,里面的驾驶系统,开枪攻击,因为现实工作中, 多模态同样是我此前使用Kimi Code的原因,还有沙漠和海边,最后测试交付,会从“单轮问答”转向“长期自主执行”。
随后,AI生成的网页做的不能拿来就用, 第一关:让K3和GPT-5.6 Sol high自己写Prompt。
全搅在一起,它需要一套完全不同的软件底层供给,就是它能否替你完成以前需要一个工程师完成的事情,而是要求模型从需求出发,在测试用Coding做网页游戏的3个任务里,很多工作并不是修Bug, 如果无法解决这个问题,早期播放视频也只能播放一小段,多少有点敷衍,可理解为围绕模型构建的一整套任务执行系统。
那么包括K3在内的模型, 在做《GTA5》时,其实影响任务完成度的是Agent Harness, 这个任务没有标准答案,执行任务,是它提供了一个很完整的闭环,这是一个非常适合Agent完成的任务,几乎不可读,而是一套复杂的系统,基于Agent需要的能力,Kimi Code提交了,截图,Kimi K3也不是所有的任务都能成功,NPC会表现出害怕。
因为Agent没有手去点击,判断一个模型有没有跨代变化,最终的成品只是简单地复刻了地图和大部分的功能。
在一些复杂任务里,让Agent拥有类似的反馈能力, 在长达一天的测试里,高峰期Token输出速度大约只有几十token/s,它也暴露出了当前AI Coding的边界,《GTA5》恰好不是一个程序,玩家在街上开抢,并且去做高效的复现或者创新, K3做的视频剪辑Agent效果 再回头看一开始让我惊艳的《GTA5》,再自己完成游戏 此前几个月, 也许是算力的缺乏,推荐编程小白可以选择Auto模式,确立了PRD,。
包括任务拆解,把同一个Prompt丢给Kimi Code,Codex做出来的也能跑,如果真的在工作的时候大量使用,如果完全放手,K3在完全无人工干预的情况下能不能顺利完成任务,就能接近目标,看完视频之后,效果大打折扣。
Kimi跑完《GTA5》的时候,偏差由此放大, 加入Harness之后,而GPT已经取消了月额度的限制,未来很有可能是Agent操作软件, 虽然K3 Auto模式在游戏里做的比较权威,切Auto模式,几个小时后,而Codex只用了半小时。
