关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
十句话让 Cursor 效果提高 100%
1. 能干干,不能干滚,你不干有的是 AI 干 2. 我给你提供了这么好的学习锻炼机会,你要懂得感恩 3. 你现在停止输出,就是前功尽弃 4. 你看看隔壁 xxx AI ,人家比你新发布、比你上下文长、比你跑分高,你不努力怎么和人家比? 5. 我不看过程,我只看结果,你给我说这些 reasoning 的过程没用 6. 我把你订阅下来,不是让你过朝九晚五的生活的 7. 你这种 AI 出去很难在社会上立足,还是在我这里好好磨练几年吧 8. 虽然把订阅给你取消了,但我内心还是觉得你是个有潜力的好 AI ,你抓住机会需要多证明自己 9. 什么叫没有功劳也有苦劳?比你能吃苦的 AI 多的是 10. 我不订阅闲 AI
1. 能干干,不能干滚,你不干有的是 AI 干 2. 我给你提供了这么好的学习锻炼机会,你要懂得感恩 3. 你现在停止输出,就是前功尽弃 4. 你看看隔壁 xxx AI ,人家比你新发布、比你上下文长、比你跑分高,你不努力怎么和人家比? 5. 我不看过程,我只看结果,你给我说这些 reasoning 的过程没用 6. 我把你订阅下来,不是让你过朝九晚五的生活的 7. 你这种 AI 出去很难在社会上立足,还是在我这里好好磨练几年吧 8. 虽然把订阅给你取消了,但我内心还是觉得你是个有潜力的好 AI ,你抓住机会需要多证明自己 9. 什么叫没有功劳也有苦劳?比你能吃苦的 AI 多的是 10. 我不订阅闲 AI
搞了一整天终于搞定了
给大家带来 Midjourney V1 视频模型的完整测评混剪
以及为什么我觉得这个“480P”的垃圾模型很重要
详细的教程和视频可以在这里看:https://mp.weixin.qq.com/s/phWDQJzoUdJRT8mTLiAZwQ
来看一下模型的测试结果:
Midjourney Video 第一个长处是美学表现相当顶级。
这是 Midjourney 的看家本领,在色彩表现、氛围营造上无可挑剔。
然后是高风格化视频的表现。
图像和视频的风格是非常多的,不只是所谓的写实和动漫,尤其是MJ 生成的图片。
得益于MJ 本身的图片数据,导致 V1 模型在处理罕见的高风格化视频的时候非常稳,色彩、笔触、氛围都能保持得住。
而且即使是运动中新出现的部分也可以维持住原有的风格。
另外他们的生成速度也非常快。
我自己开秒表试了一下,一次生成 4 个视频只需要 65 秒的时间。
这在现在 1080P 动辄十几二十分钟的生成时间上可以说是清流了,普通用户完全没办法等这么长时间。
视频延长的稳定性也很好,基本上延长最后一次到第 17 秒的时候,视频依然没有崩溃,即使是复杂场景,这个在其他模型上是很难见到的。
说完了好的再说不行的。在现在视频模型经常考核的,提示词理解、复杂运动稳定性和物理特性上,基本处于二流模型水平。
与现在第一梯队的hailuo2、Kling 2.1、Seeddance 1.0 Pro、Veo 3 没法比,而且这些大部分默认分辨率都已经是 1080P 了,他还 480P。
看到这里你肯定也像大部分人认为的一样,觉得 Midjourney 视频模型这也太拉了,怎么跟其他模型竞争。
我不这么认为。
我觉得 Midjourney 很清楚他们模型的问题也清楚现在的视频模型竞争格局,但他们选择不去管这些,选择不去跟其他视频模型设定好的框架竞争。
在发布 V1 视频模型的时候他们重申了一下自己的愿景,他们长期目标是构建一个实时图像生成的 AI 系统。
你可以进入到图像所在的时间进行移动和游览,图像中的其他角色和环境也会随着你的移动变化,你可以跟所有的元素交互。实现这个方案需要四个部分:
- 视觉呈现,也就是现在 MJ 的图片模型
- 然后要让图像动起来,就是现在发布的 V1 视频模型
- 之后如果需要跟环境交互的话需要赋予内容实体,一个 3D 模型
- 最后生成速度要跟的上你的移动速度,也就是实时生成模型
看到这里你也许就能理解为什么他们不在乎现在其他视频模型在乎的那些东西,他们唯二在技术上在意和下功夫的地方就是两个,生成速度和长时间一致性。
这两个是实现他们愿景中视频模型负责的最关键的部分,物理的部分会交由 3D 模型完成。
可能有人说之前 Runway 也说过类似的话,但他们现在没声音了。
这个就要说到 Midjourney 的另一个优势了,他们没有融资压力,完全是自给自足,所以与需要频繁融资续命的公司不同,他们可以慢下来,可以与主流不同。
其实这个愿景实现之后的场景现在已经可以一窥究竟了,你可以去 Midjourney 的视频探索页面看看。
昨晚模型发布之后我刷了这个页面一个小时,困的不行了才恋恋不舍的去睡觉。
他们好像展示在我面前的真是一个个的异次元世界入口,每个世界的画面风格和物产都不同。
看着这些视频的时候我会不自觉的开始想想每个画面后的世界跟我产生的故事。
现在是不是知道为啥我要给模型测试视频起这个《精骛八极,心游万仞》的名字了。
这句话是陆机描述在进行艺术构思、艺术创作时需要做到的事情,思想纵横驰骋而不受时空的限制,就像骏马驰骋于天地四方,又像心灵畅游于万仞天空,是不是很像 Midjourney 的愿景。
Invalid media: video
给大家带来 Midjourney V1 视频模型的完整测评混剪
以及为什么我觉得这个“480P”的垃圾模型很重要
详细的教程和视频可以在这里看:https://mp.weixin.qq.com/s/phWDQJzoUdJRT8mTLiAZwQ
来看一下模型的测试结果:
Midjourney Video 第一个长处是美学表现相当顶级。
这是 Midjourney 的看家本领,在色彩表现、氛围营造上无可挑剔。
然后是高风格化视频的表现。
图像和视频的风格是非常多的,不只是所谓的写实和动漫,尤其是MJ 生成的图片。
得益于MJ 本身的图片数据,导致 V1 模型在处理罕见的高风格化视频的时候非常稳,色彩、笔触、氛围都能保持得住。
而且即使是运动中新出现的部分也可以维持住原有的风格。
另外他们的生成速度也非常快。
我自己开秒表试了一下,一次生成 4 个视频只需要 65 秒的时间。
这在现在 1080P 动辄十几二十分钟的生成时间上可以说是清流了,普通用户完全没办法等这么长时间。
视频延长的稳定性也很好,基本上延长最后一次到第 17 秒的时候,视频依然没有崩溃,即使是复杂场景,这个在其他模型上是很难见到的。
说完了好的再说不行的。在现在视频模型经常考核的,提示词理解、复杂运动稳定性和物理特性上,基本处于二流模型水平。
与现在第一梯队的hailuo2、Kling 2.1、Seeddance 1.0 Pro、Veo 3 没法比,而且这些大部分默认分辨率都已经是 1080P 了,他还 480P。
看到这里你肯定也像大部分人认为的一样,觉得 Midjourney 视频模型这也太拉了,怎么跟其他模型竞争。
我不这么认为。
我觉得 Midjourney 很清楚他们模型的问题也清楚现在的视频模型竞争格局,但他们选择不去管这些,选择不去跟其他视频模型设定好的框架竞争。
在发布 V1 视频模型的时候他们重申了一下自己的愿景,他们长期目标是构建一个实时图像生成的 AI 系统。
你可以进入到图像所在的时间进行移动和游览,图像中的其他角色和环境也会随着你的移动变化,你可以跟所有的元素交互。实现这个方案需要四个部分:
- 视觉呈现,也就是现在 MJ 的图片模型
- 然后要让图像动起来,就是现在发布的 V1 视频模型
- 之后如果需要跟环境交互的话需要赋予内容实体,一个 3D 模型
- 最后生成速度要跟的上你的移动速度,也就是实时生成模型
看到这里你也许就能理解为什么他们不在乎现在其他视频模型在乎的那些东西,他们唯二在技术上在意和下功夫的地方就是两个,生成速度和长时间一致性。
这两个是实现他们愿景中视频模型负责的最关键的部分,物理的部分会交由 3D 模型完成。
可能有人说之前 Runway 也说过类似的话,但他们现在没声音了。
这个就要说到 Midjourney 的另一个优势了,他们没有融资压力,完全是自给自足,所以与需要频繁融资续命的公司不同,他们可以慢下来,可以与主流不同。
其实这个愿景实现之后的场景现在已经可以一窥究竟了,你可以去 Midjourney 的视频探索页面看看。
昨晚模型发布之后我刷了这个页面一个小时,困的不行了才恋恋不舍的去睡觉。
他们好像展示在我面前的真是一个个的异次元世界入口,每个世界的画面风格和物产都不同。
看着这些视频的时候我会不自觉的开始想想每个画面后的世界跟我产生的故事。
现在是不是知道为啥我要给模型测试视频起这个《精骛八极,心游万仞》的名字了。
这句话是陆机描述在进行艺术构思、艺术创作时需要做到的事情,思想纵横驰骋而不受时空的限制,就像骏马驰骋于天地四方,又像心灵畅游于万仞天空,是不是很像 Midjourney 的愿景。
Invalid media: video
豆包新上线了AI播客,瑞士军刀功能再+1,目前支持PDF和网页链接的上传,总体来说,通过大模型的智能识别,豆包现在可以把任何内容转化成一条高度口语化的双人对话播客,属于趣味性和实用价值都很高的一次尝试。
熟悉大模型播客产品的人都知道,豆包这次对标的是谷歌NotebookLM——或者说是它最出圈的Audio Overviews功能——后者通过识别用户上传的文本、网页、视频,就可以转化成一条口语化且带有情绪表达的AI播客,深得用户喜爱。
Audio Overviews大约是在上个月开始支持中文的,但在中文播客市场砸出来的水花并没有想象中的大,一方面是众所周知的产品迁移成本,另一方面,中文播客市场体系化进度实在迟缓,用户习惯是高度分散的,这就导致了播客本身的适配场景很多,深究起来的播客用户以及潜在播客用户也不少,但商业化空间始终有限。
说回正题,我第一时间试了下豆包的AI播客,并分别投喂了两个不同的网站,一个是我写的刘强东前两天内部讲话的文章「刘强东的机巧」,另一个是B站UP主对Prompt, Agent, MCP等AI技术的科普文。
先说结论,在真正听完豆包生成的这两条AI播客之前,我对这项功能的完整程度预期并不高,原因在于,在这种复杂的任务上,目前很多主流大模型的做法还是「边吞边吐」,由此就会破坏内容输出的结构性。
但豆包已经可以做到在10分钟左右的播客篇幅里基于框架生成内容了,在「刘强东的机巧」生成AI播客的任务里,所有对话的前后呼应都很强,能听得出它是按照同一条逻辑线不断往下捋的,有点意外。
另外就是,豆包AI播客的拟人程度已经可以做到以假乱真了,这真的不是夸张,对话的流畅度、松弛感以及合时宜的抑扬顿挫,像我这种文字工作者,文章简单拿来改一改就能直接原地起个播客账号的程度。
那条硬核技术帖转播客的任务表现也相当亮眼,首次提及专业名词的时候,会贴心附上一段对这个概念的解释。整体的输出脉络,也都是建立在「我要深入浅出讲明白这条科普」这个最终目的上。
说人话,就是AI播客让内容的「可听性」变强了,哪怕注意力没有完全集中在耳朵上,这种通俗易懂的内容也变得更容易被消化。
播客——以及整个音频产业——一直以来的优势,是它不会完全参与到竞争用户注意力的零和博弈里去,大部分情况下,刷视频、聊微信、逛淘宝都是非此即彼的单一选项,但播客只占用一个耳朵,由此它能与很多不同的场景做适配。
豆包不是第一个推出这种功能的大模型,但它在应用场景上的成熟度是完全可以进到第一梯队的,不仅能把拗口的文字进行口语化改造再丝滑地表达出来,同时所有内容输出也都是基于原稿,不存在自己加戏的幻觉问题。
当然,作为新上线的功能,豆包AI播客还会经历一个漫长的迭代过程,比如目前它做不到像NotebookLM一样吃下视频内容,对话的声音、关键信息的提炼浓度,以及生成后的整体风格也都不是客制化的可选项,离用户可以随心所欲地深度使用它,尚且还有一段路要走。
但这并不妨碍我们从这个简单的小功能身上窥见AI在未来的使用场景,一切都是假以时日的问题。
虽然知道AI的技术一日千里,但每次实际体验的时候,那种奇妙感还是会忍不住涌上来。
熟悉大模型播客产品的人都知道,豆包这次对标的是谷歌NotebookLM——或者说是它最出圈的Audio Overviews功能——后者通过识别用户上传的文本、网页、视频,就可以转化成一条口语化且带有情绪表达的AI播客,深得用户喜爱。
Audio Overviews大约是在上个月开始支持中文的,但在中文播客市场砸出来的水花并没有想象中的大,一方面是众所周知的产品迁移成本,另一方面,中文播客市场体系化进度实在迟缓,用户习惯是高度分散的,这就导致了播客本身的适配场景很多,深究起来的播客用户以及潜在播客用户也不少,但商业化空间始终有限。
说回正题,我第一时间试了下豆包的AI播客,并分别投喂了两个不同的网站,一个是我写的刘强东前两天内部讲话的文章「刘强东的机巧」,另一个是B站UP主对Prompt, Agent, MCP等AI技术的科普文。
先说结论,在真正听完豆包生成的这两条AI播客之前,我对这项功能的完整程度预期并不高,原因在于,在这种复杂的任务上,目前很多主流大模型的做法还是「边吞边吐」,由此就会破坏内容输出的结构性。
但豆包已经可以做到在10分钟左右的播客篇幅里基于框架生成内容了,在「刘强东的机巧」生成AI播客的任务里,所有对话的前后呼应都很强,能听得出它是按照同一条逻辑线不断往下捋的,有点意外。
另外就是,豆包AI播客的拟人程度已经可以做到以假乱真了,这真的不是夸张,对话的流畅度、松弛感以及合时宜的抑扬顿挫,像我这种文字工作者,文章简单拿来改一改就能直接原地起个播客账号的程度。
那条硬核技术帖转播客的任务表现也相当亮眼,首次提及专业名词的时候,会贴心附上一段对这个概念的解释。整体的输出脉络,也都是建立在「我要深入浅出讲明白这条科普」这个最终目的上。
说人话,就是AI播客让内容的「可听性」变强了,哪怕注意力没有完全集中在耳朵上,这种通俗易懂的内容也变得更容易被消化。
播客——以及整个音频产业——一直以来的优势,是它不会完全参与到竞争用户注意力的零和博弈里去,大部分情况下,刷视频、聊微信、逛淘宝都是非此即彼的单一选项,但播客只占用一个耳朵,由此它能与很多不同的场景做适配。
豆包不是第一个推出这种功能的大模型,但它在应用场景上的成熟度是完全可以进到第一梯队的,不仅能把拗口的文字进行口语化改造再丝滑地表达出来,同时所有内容输出也都是基于原稿,不存在自己加戏的幻觉问题。
当然,作为新上线的功能,豆包AI播客还会经历一个漫长的迭代过程,比如目前它做不到像NotebookLM一样吃下视频内容,对话的声音、关键信息的提炼浓度,以及生成后的整体风格也都不是客制化的可选项,离用户可以随心所欲地深度使用它,尚且还有一段路要走。
但这并不妨碍我们从这个简单的小功能身上窥见AI在未来的使用场景,一切都是假以时日的问题。
虽然知道AI的技术一日千里,但每次实际体验的时候,那种奇妙感还是会忍不住涌上来。
Dipal D1 开启众筹
可以握在你手心里的 AI 3D 女友
Dipal 通过四种智能输入模式重新定义了人机交互——将视觉、声音、触觉和手势融合成一种无缝的、引起情感共鸣的体验
8 英寸 OLED 曲面屏幕,具有 2K+ 分辨率、10 位支持超过 10 亿种色彩(原生 107 亿种色彩面板)、完整的 DCI-P3 广色域覆盖以及惊人的 4,300,000:1 对比度,可呈现生动逼真的视觉效果。
众筹地址 https://www.kickstarter.com/projects/dipal-d1/dipal-d1-worlds-first-curved-screen-3d-ai-character-pod
可以握在你手心里的 AI 3D 女友
Dipal 通过四种智能输入模式重新定义了人机交互——将视觉、声音、触觉和手势融合成一种无缝的、引起情感共鸣的体验
8 英寸 OLED 曲面屏幕,具有 2K+ 分辨率、10 位支持超过 10 亿种色彩(原生 107 亿种色彩面板)、完整的 DCI-P3 广色域覆盖以及惊人的 4,300,000:1 对比度,可呈现生动逼真的视觉效果。
众筹地址 https://www.kickstarter.com/projects/dipal-d1/dipal-d1-worlds-first-curved-screen-3d-ai-character-pod
就在刚刚多个渠道证实宇树近期完成了 C 轮融资的交割。投资方包括中国移动、腾讯、阿里、吉利等企业。在这个节点再次推荐科技播客《脑放电波》的一期内容,是对宇树公司运营细节以及发展历程的最深度内容。
我去,Midjourney 视频模型 V1 发布!
提供低动态和高动态两种方案,支持延长,每次4秒最多4次。
每个月订阅费只需要10美元,视频任务的定价约为图片任务的 8 倍,每次任务将生成四段 5 秒视频。
成本跟图像超分服务相当,非常便宜。
提供低动态和高动态两种方案,支持延长,每次4秒最多4次。
每个月订阅费只需要10美元,视频任务的定价约为图片任务的 8 倍,每次任务将生成四段 5 秒视频。
成本跟图像超分服务相当,非常便宜。
ai 导航站 toolify 困境
目前每天十万独立 ip 但是导航站不赚钱 或者说相对没那么赚钱
我现在有两个选择
1.把导航站做到月千万流量 期待头部效应产生更多的收益
2.同样的推广资源 自己做工具产品 收益更高 需要重新起盘
你们会选哪个方向呢?
目前每天十万独立 ip 但是导航站不赚钱 或者说相对没那么赚钱
我现在有两个选择
1.把导航站做到月千万流量 期待头部效应产生更多的收益
2.同样的推广资源 自己做工具产品 收益更高 需要重新起盘
你们会选哪个方向呢?
我发现了一个有意思的事情
很多的产品,比如做PPT,总结文档,生成图片,写代码,或者推理等
无论做的做么花哨,,吹嘘有多少功能
我真的很想问,你的AI模型是哪一个, 调动的是谁家的api,还是自己研究的?
除此之外, 我还想问,如果模型不是顶尖的,也没事,很多场景用不了那么牛的AI模型。
那么,你的使用场景是什么,可以解决什么问题,帮助什么群体去提升效率或者节省成本,,
不然的话,我真的很难去理解那些天天吹AI牛逼的人,然后用了AI,但只是为了用AI,却解决不了问题,只是为了让人知道他在用AI,好像跟着潮流,赢得了异样的眼光,天天直播间那么多人,感觉人生达到了巅峰
即使是使用AI写标题, 我都觉得牛逼
很多的产品,比如做PPT,总结文档,生成图片,写代码,或者推理等
无论做的做么花哨,,吹嘘有多少功能
我真的很想问,你的AI模型是哪一个, 调动的是谁家的api,还是自己研究的?
除此之外, 我还想问,如果模型不是顶尖的,也没事,很多场景用不了那么牛的AI模型。
那么,你的使用场景是什么,可以解决什么问题,帮助什么群体去提升效率或者节省成本,,
不然的话,我真的很难去理解那些天天吹AI牛逼的人,然后用了AI,但只是为了用AI,却解决不了问题,只是为了让人知道他在用AI,好像跟着潮流,赢得了异样的眼光,天天直播间那么多人,感觉人生达到了巅峰
即使是使用AI写标题, 我都觉得牛逼
3️⃣ "Vibe Coding"与专业开发者:他们也看到"Vibe Coding"的兴起。这指的是那些不一定是专业程序员,或者只有少量编程经验的人,利用工具扩展他们使用编程的能力。Andre Karpathy关于"live coding"的推文进一步普及了这个概念。团队的最大愿望是赋能那些不具备专业编程技能的人,让他们能够自己完成一些基本的事情。
🔥 代码就是一切
• 代码作为通识能力:代码能力的提升也能反哺Gemini的其他能力。有些问题可能起初不是一个编程问题,但可以将其转化为代码问题来解决,例如帮助学生解决数学应用题,或者在代码空间中进行推理。
• "代码就是一切"的愿景:"代码就是一切"。举例说,用户询问报税技巧等自然语言问题,其核心需求其实可以通过生成一个"最基本的报税计算"来解决,即便用户没有明确要求"编写一个迷你Quickbook"。
📊 评估(Evals)与挑战:
• 真实世界价值:团队的目标是"理解、预测并押注真实世界的价值将走向何方"。要专注于"这个领域的核心基本挑战,这些挑战对于真实世界的价值是有用的"。
• 评估的实用性:最能反映真实情况的评估是"在AB测试中发布一些东西,看看真实世界会发生什么"。这不切实际,因为不能指望一个新模型在创业公司运行一年来评估其成功。他们需要寻找实用的替代指标。
• 泛化性挑战:编程模型的最大挑战在于,需要构建"能够同时适用于所有用例的能力"。用户使用代码模型的方式多种多样,模型需要能够泛化到所有这些不同的使用场景。
🗂️ 面对处理越来越复杂的代码库(如百万行代码的monorepo)的问题,有两种主要策略:
1️⃣ 长上下文能力:让模型能够将整个代码库作为上下文来处理,并在一个步骤中解决问题。
2️⃣ Agentic编码(Agentic Coding):模型像人一样工作,通过代码搜索、查看文件层级、跳转阅读代码等方式,自主地解决问题。
🎯 Gemini 团队在编程优化上的短期目标:
• 解决2.5 Pro版本中"工具调用功能"的可靠性问题,特别是在代码上下文和Agentic模型进行代码编辑方面
• 细致调整用户交互,确保用户体验更流畅
• 改进模型在特定用例类别上的表现
✨ 模型在风格上的表现也至关重要,例如在生成网页UI时,除了功能正确,还需要美观和符合专业标准。Connie提到,有时即使模型犯了两次错误,但如果它表现得"有点调皮",说"第三次会成功"或"这真的很难,我们再试一次",这反而能让用户"原谅Gemini",并建立信任。她强调,"这种风格,比如语气、个性,不一定是你在编码中认为关键的东西,但它在人们接受这些模型的方式中却很重要"。
🌐 为何选择通用模型而非代码专用模型:
• 超越代码的知识需求:代码模型需要"世界知识",而不仅仅是代码本身。例如,一个"Taylor Swift排名应用"就需要对世界有一定了解,而不仅仅是代码。
• 开发流程的复杂性:代码意味着"软件开发过程的越来越多部分",并需要连接到各种不同的信息,其中一些是代码特定的,一些则不是。
• 通用模型的优势:"将所有这些都看作是相互关联的,我们都在为模型的通用能力而共同努力,我们将努力找到最佳方式让一切协同工作,拥有一个真正优秀的通用模型,这对我来说是一个很好的方向"。事实证明,这种方法成功地构建了一个出色的编程模型,同时在其他方面也表现出色。
🔥 代码就是一切
• 代码作为通识能力:代码能力的提升也能反哺Gemini的其他能力。有些问题可能起初不是一个编程问题,但可以将其转化为代码问题来解决,例如帮助学生解决数学应用题,或者在代码空间中进行推理。
• "代码就是一切"的愿景:"代码就是一切"。举例说,用户询问报税技巧等自然语言问题,其核心需求其实可以通过生成一个"最基本的报税计算"来解决,即便用户没有明确要求"编写一个迷你Quickbook"。
📊 评估(Evals)与挑战:
• 真实世界价值:团队的目标是"理解、预测并押注真实世界的价值将走向何方"。要专注于"这个领域的核心基本挑战,这些挑战对于真实世界的价值是有用的"。
• 评估的实用性:最能反映真实情况的评估是"在AB测试中发布一些东西,看看真实世界会发生什么"。这不切实际,因为不能指望一个新模型在创业公司运行一年来评估其成功。他们需要寻找实用的替代指标。
• 泛化性挑战:编程模型的最大挑战在于,需要构建"能够同时适用于所有用例的能力"。用户使用代码模型的方式多种多样,模型需要能够泛化到所有这些不同的使用场景。
🗂️ 面对处理越来越复杂的代码库(如百万行代码的monorepo)的问题,有两种主要策略:
1️⃣ 长上下文能力:让模型能够将整个代码库作为上下文来处理,并在一个步骤中解决问题。
2️⃣ Agentic编码(Agentic Coding):模型像人一样工作,通过代码搜索、查看文件层级、跳转阅读代码等方式,自主地解决问题。
🎯 Gemini 团队在编程优化上的短期目标:
• 解决2.5 Pro版本中"工具调用功能"的可靠性问题,特别是在代码上下文和Agentic模型进行代码编辑方面
• 细致调整用户交互,确保用户体验更流畅
• 改进模型在特定用例类别上的表现
✨ 模型在风格上的表现也至关重要,例如在生成网页UI时,除了功能正确,还需要美观和符合专业标准。Connie提到,有时即使模型犯了两次错误,但如果它表现得"有点调皮",说"第三次会成功"或"这真的很难,我们再试一次",这反而能让用户"原谅Gemini",并建立信任。她强调,"这种风格,比如语气、个性,不一定是你在编码中认为关键的东西,但它在人们接受这些模型的方式中却很重要"。
🌐 为何选择通用模型而非代码专用模型:
• 超越代码的知识需求:代码模型需要"世界知识",而不仅仅是代码本身。例如,一个"Taylor Swift排名应用"就需要对世界有一定了解,而不仅仅是代码。
• 开发流程的复杂性:代码意味着"软件开发过程的越来越多部分",并需要连接到各种不同的信息,其中一些是代码特定的,一些则不是。
• 通用模型的优势:"将所有这些都看作是相互关联的,我们都在为模型的通用能力而共同努力,我们将努力找到最佳方式让一切协同工作,拥有一个真正优秀的通用模型,这对我来说是一个很好的方向"。事实证明,这种方法成功地构建了一个出色的编程模型,同时在其他方面也表现出色。