关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
和阿文一起搭建了哈利波特单人动态 AI 海报工作流。

上传一张你的照片,分院帽会为你自动分配学院,生成你的动态肖像照。除了四个学院外,有一定概率被发配阿兹卡班。

工作流下载地址:https://openart.ai/workflows/profile/ladybird_musty_24

线上试玩地址(个人电脑 self host 给大家玩 1 天,每个人最多玩 1 次哈,周四下架): https://tt.9syun.com/app/index.php?i=66&c=entry&do=mobile&m=tech_huise&r=index.index.index#/pages/detail/detail?id=600
Streamer-Sales 销冠 —— 卖货主播大模型

链接:https://github.com/PeterH0323/Streamer-Sales
该模型能深度理解商品特点,以生动、精准的语言为商品量身打造解说词,让每一件商品都焕发出诱人的光彩。无论是细节之处,还是整体效果,都能通过其细腻、独到的解说,激发用户的购买欲望。
intp怎么就不算机器人了
新世相即将发布一个 campaign,「AI 你好,我死以后」。我们邀请一万年轻人,与 AI 交谈,写下他们的遗嘱…

项目做得七七八八了,十分令人兴奋。但我们还没想好怎么发布,有兴趣一起发布的产品/公司/品牌,(尤其是有mktg预算的😎),欢迎微信联系我。
分析框架:
观点:具身智能在消费市场五年内没有机会。

事实:科研、工程、投资、生产、市场不断向前递进迭代。要经历很多年。

观点:当下阶段走到哪里了呢?工程试产阶段,早期融资阶段。

事实:以驾驶为例,这是一个标准化、价值高的超大市场。但很少有人选择用具身机器人去坐在驾驶位作为自动驾驶解决方案,而是选择将系统内嵌在汽车中。这一方案即将实现。

观点:垂直领域机器人会越来越快发展,而具身机器人在软硬件技术、工程、成本、市场等多个方面都存在不成熟,这必定会经历反复很多年的发展。

结论:机遇和阶段对于不同的人完全不一样!!!你是投资还是创业,是技术工作还是管理工作?掌握产业发展周期,根据自己的资源禀赋在合适时机切入赛道才是正确的选择。
Claude有了artifacts之后,用来写一些小项目基本没什么问题了,一些对人类实习生的沟通技巧对他也有效:

- 让他先从最简单基础的功能开始写,然后一轮轮提修改意见,这样可以方便检查他的作业,及时给反馈
- 文件长了就让他拆分,这样每次迭代只需要修改相关的文件,可以很方便看出修改了多少,回复的文本量也不容易超出一次输出的token限制
- 如果对他写的部分代码忍不了要亲自动手了,也把修改后的代码告诉他,让他直接看代码学习怎么做

不过人类实习生随着指导会慢慢进步,成长之后不需要花费那么多精力做精细的指导了。
而AI随着上下文变长,慢慢记不住前面的指令,犯的错只会越来越多,恨不得让他回炉重造,重开上下文
大进展!

今天学会自己写节点了,在 ComfyUI easyuse 的基础上改了 text switch 和 image switch

根据用户不同的选择,输入不同的预制 prompt 和背景图!

请叫我小小工程师 🙂‍↔️
据说是今年WAIC最高光的一个片段


哈哈哈哈哈扶我一下我腰,笑死我了🤣
可食用的机器人和7个人形机器人模型 |产品动向 04 ·CyberRobo

这份产品动向专栏,是CyberRobo为在研究和创造人形机器人的伙伴提供的一份每周信息通讯,追踪那些灵巧手、机器人皮肤、传感器等核心部件的产品、技术或模型的进展,目的是让人形机器人可以更好地执行任务和服务人类。

本期的主题是人形机器人模仿学习与训练、机器人模型
那些你不知道的 AI 产品,正在海外闷声赚大钱 | 对谈高宁: Linkloud 联创,OnBoard! 主播 - 十字路口Crossing

🟡 AI + 出海,是 2024 年最热门的创业选择。一大批中国创业者借助 AI 的风潮,开启了他们的大航海时代。

这是一期播客「OnBoard!」与「十字路口」的串台节目,因为我们注意到,已经有不少出海的 AI 公司赚到了第一桶金。因此,在这期播客,我们尝试提炼和总结这些公司的共性,希望能为大家拓宽思路,带来一些灵感。
#waic2024
总结起来:机器人各行业大模型
从百模大战到千帆竞发,应用落地的战场接下来几年会开花。现在 ai 也像个孩子哈哈哈
看好机器人,看好ai。五年内不看好具身机器人。
最近拜读了去年火热的斯坦福AI小镇文章的作者Joon Sung Park的两篇文章,分别是22年的Social Simulacra和23年的Generative Agents(斯坦福AI小镇本文)。两篇都发在交互顶会UIST上(后者得了best paper)

比起Generative agents,22年发表的Social Simulacra聚焦于一个更小的领域- 交互设计原型(prototyping)。具体的思路是:交互原型设计师常常需要了解一个设计的效果,目前的常用做法是招募少量的真人做用户调查。

然而,现实情况下,少量用户的反馈往往并不能体现出这个设计的实际效果,或者使用的潜在隐患。这是因为“用户的行为会彼此影响”。

作者在这里举了“反社会行为”作为例子,比如说,一个人在使用社交媒体时,可能只会根据自己的信息发表观点,但是当很多人都参与讨论时,就会带来煽动性言论(inflammatory comments)或者钓鱼引战(trolling)等现象。这样的问题在小规模的用户测试中是无法被检测到的。

为了在“设计阶段”就能了解到大规模用户可能涌现的群体行为,有一种特定的方法叫做social computing system。这个方法可以看作代理人基模型(agent-based model)在设计学中的应用。尽管代理人基模型在其他学科里已经有很广泛的应用了,但是在设计和用户体验方面的探索还很少,这是本研究的一个创新点。

这篇文章的另一个亮点在于,使用了大语言模型(llm):首先,设计师把自己的设计意图输入给语言模型,然后语言模型生成一系列的用户行为(比如发帖/回复)。基于大量社交媒体数据训练的GPT3,已经足够生成各种积极或者消极的回复,其中也包含作者关注的反社会行为。

最后,作者通过用户实验+一个类似于图灵实验的方式来说明这个方法的有效性:让用户区分真实的用户行为,和使用Social Simulacra生成的用户行为。结果显示,用户在超过40%的数据上都无法判断这是真人还是生成数据,这说明了Social Simulacra在模拟真实用户的表现上效果很好。

阅读22年的Social Simulacra一文,可以看到很多Generative agents的影子:二者都使用了大语言模型(GPT3和GPT3.5),二者都尝试用llm去模拟人(一种是社交媒体行为,一种是生活行为),二者都考虑到了人类互相影响所带来的1+1>2的集体效应,并尝试用技术的方法去模拟这种人类群体效应。

两句话总结体会:1. 阅读Social Simulacra对于理解Generative Agents的想法有很大的帮助,两者结合更可以体现作者思考的连贯性。2. 此外,作者对前沿技术的敏感也让人惊讶。想到这篇文章要在22年3月投稿,而gpt3在20年6月才首次发布beta版本。要在很短的时间内把一项尚不成熟的技术用于解决跨学科问题,作者的技术嗅觉真是很准确也很超强啊。
最近一周时间在上海、深圳、北京见了近20位一线AI从业者,其中包括投资人,大厂AI业务&模型厂&应用厂的员工,独立开发者,founder。很累,收获也很多。总结一下我觉得重要的共识和非共识,以下内容没有优先顺序,想到哪写到哪:

1.关于竞争:大厂、模型厂、应用厂
大厂没有逃脱局部兵力不足的问题,越是铺得广的厂这个问题越严重,字节的遍历填格子打法在业务相似度低的时候是人才密度不够的,战术上重视就行。反而阿里的通义因为更研究院模式,没有主核,分布式创新使得反而跑出来一些模型和应用侧有意思的东西,这个很值得大厂内部思考一下。
模型厂基于GPT-5迟迟不到,可能也判断出了,算力未必是万能解药,开始卷差异化,差异化对于tob的竞争尤为重要。但国内的模型厂还有一个不得不卷应用的任务,但不基于模型差异化的应用很难卷出用户体验增量,各位厂里的小伙伴都在努力地拉齐共识和内部创新的过程中。
应用厂,AI搜索的共识形成得太快了,其实没有留下太多保护期,大明牌的卷度会很激烈。反而是AI+every thing因为去年的过分乐观到今年的幻灭,留出了大量的创新保护窗口,给不迷信AI解决一切问题,但试图先用AI对具体领域做一些用户体验提升的公司留下了机会。
额外补一个硬件厂,世界上还有大量的数据没有被搜集,每个带有数据收集器的硬件厂都有属于自己的机会,但硬件厂目前很少有软硬一体的能力。补齐短板的玩家会可能会跑出来新东西。

2.关于模型能力
GPT-4o展示了快非常重要,快是核心体验之一,那么moe就必须得卷了,groq这种加速的基建也会变得非常有价值。如果大规模的智力代差比如3.5->4不会卷得那么快的话,代差之间可能更多是成本和速度的竞争。
长上下文很牛,但低成本的长上下文才有意义,基于长上下文成本急剧下降这个假设,能解决很多当前的用户体验问题。
多模态暂时在应用层的优势不明显,不考虑终态世界模型之类的,当前可能主要体现在一些之前没覆盖到的小CV场景。
fine - tuning不是净提升,是某类问题解决的更好,但通用问题更差的trade off,可以通过调整尽量降低负面影响,但从技术成本和数据成本来考虑,暂时很难作为可普及的常用武器库。
更细分的卷法,卷RAG,卷function call,卷代码能力,卷交互理解,卷情绪理解等等
可能真正值得卷的是意图识别,意图识别才是ai的推荐系统。

3.关于投融资
国内目前的情况是:创业者说市场温度低难拿钱,投资人说好项目少没法投。回到本质还是大家想用钱干什么,如果是为了加速市场形成,烧出一个煊赫盛世应该是不太可能了,因为各有各的难处,但如果真的想要构建一个未来5-10年在AI世界有独特社会分工的企业,大家还是很认可的。但目前市面上能持之以恒解自己的题的人很稀缺。
海外听到了多种说法,鉴于没有一手信息就不评价了,但如果做海外市场,还是建议谨慎考虑融资动作。

4.关于用户需求
PMF对还是TMF对?还是前者对,但现在加了一层技术可行性的约束,使用门槛很高,但体验提升巨大,也有机会。
工具效率/工作流,这是目前AI落地得最好的部分,但目前最大公约数已经挖完了,而AI目前远达不到数字员工的级别,很长一段时间基于某个职业的AI工作流copilot应该都是主要落地形式。tob和toc在这个领域都能持续跑出来赚钱的东西。
情感陪伴/内容消费,成本下不来,质量上不去,商业模式讲不清楚(付费逻辑只有hs内容能跑通,免费逻辑留存一直上不去)。

AI也不是唯一主线,AR眼镜等硬件对原本手机场景的分割,电话、拍照、翻译。还有web3。基于满足用户需求来思考,AI未必是唯一的锤子。

5.关于长期主义的优劣势
这回出来有一个比较深的感受是,基本上可以把founder分为偏长期主义和不偏长期主义两类,而这两类似乎都有其生存空间和价值。
因为我的个人偏好,所以说明一下长期主义的优劣势:
优势是,长期主义在各类决策上,难度都会降纬,因为长期主义代表你对于未来世界是有一个大概想象的,你知道五年之后想要什么,所以对于判断做什么不做什么会变容易,对于招谁不招谁也会变得容易。单一目标的决策总是比多目标的决策好做。
劣势是,早期找PMF切入点可能会非常难且漫长,对于耐力、定力和资源的要求会更高,是的,长期主义是更消耗资源的,因为反馈周期会更长。
实践了一把用爷爷奶奶的老照片做出高质量的视频,家里人都很开心,感谢技术
快手再放大招!可灵真成世界第一视频生成模型了。

发布一系列重磅更新:

基础模型升级,生成更高分辨率的视频
增加首尾帧控制
增加运镜控制,还有自动大师运镜
Web 端上线,限时免费

新模型的运动幅度和清晰度完全可以跟Gen3对标,同时美学表现也获得了提升。

控制方式更是吊打现有DiT模型。

Web端地址:https://klingai.kuaishou.com/

Invalid media: video
Back to Top