关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
那些你不知道的 AI 产品,正在海外闷声赚大钱 | 对谈高宁: Linkloud 联创,OnBoard! 主播 - 十字路口Crossing

🟡 AI + 出海,是 2024 年最热门的创业选择。一大批中国创业者借助 AI 的风潮,开启了他们的大航海时代。

这是一期播客「OnBoard!」与「十字路口」的串台节目,因为我们注意到,已经有不少出海的 AI 公司赚到了第一桶金。因此,在这期播客,我们尝试提炼和总结这些公司的共性,希望能为大家拓宽思路,带来一些灵感。
#waic2024
总结起来:机器人各行业大模型
从百模大战到千帆竞发,应用落地的战场接下来几年会开花。现在 ai 也像个孩子哈哈哈
看好机器人,看好ai。五年内不看好具身机器人。
最近拜读了去年火热的斯坦福AI小镇文章的作者Joon Sung Park的两篇文章,分别是22年的Social Simulacra和23年的Generative Agents(斯坦福AI小镇本文)。两篇都发在交互顶会UIST上(后者得了best paper)

比起Generative agents,22年发表的Social Simulacra聚焦于一个更小的领域- 交互设计原型(prototyping)。具体的思路是:交互原型设计师常常需要了解一个设计的效果,目前的常用做法是招募少量的真人做用户调查。

然而,现实情况下,少量用户的反馈往往并不能体现出这个设计的实际效果,或者使用的潜在隐患。这是因为“用户的行为会彼此影响”。

作者在这里举了“反社会行为”作为例子,比如说,一个人在使用社交媒体时,可能只会根据自己的信息发表观点,但是当很多人都参与讨论时,就会带来煽动性言论(inflammatory comments)或者钓鱼引战(trolling)等现象。这样的问题在小规模的用户测试中是无法被检测到的。

为了在“设计阶段”就能了解到大规模用户可能涌现的群体行为,有一种特定的方法叫做social computing system。这个方法可以看作代理人基模型(agent-based model)在设计学中的应用。尽管代理人基模型在其他学科里已经有很广泛的应用了,但是在设计和用户体验方面的探索还很少,这是本研究的一个创新点。

这篇文章的另一个亮点在于,使用了大语言模型(llm):首先,设计师把自己的设计意图输入给语言模型,然后语言模型生成一系列的用户行为(比如发帖/回复)。基于大量社交媒体数据训练的GPT3,已经足够生成各种积极或者消极的回复,其中也包含作者关注的反社会行为。

最后,作者通过用户实验+一个类似于图灵实验的方式来说明这个方法的有效性:让用户区分真实的用户行为,和使用Social Simulacra生成的用户行为。结果显示,用户在超过40%的数据上都无法判断这是真人还是生成数据,这说明了Social Simulacra在模拟真实用户的表现上效果很好。

阅读22年的Social Simulacra一文,可以看到很多Generative agents的影子:二者都使用了大语言模型(GPT3和GPT3.5),二者都尝试用llm去模拟人(一种是社交媒体行为,一种是生活行为),二者都考虑到了人类互相影响所带来的1+1>2的集体效应,并尝试用技术的方法去模拟这种人类群体效应。

两句话总结体会:1. 阅读Social Simulacra对于理解Generative Agents的想法有很大的帮助,两者结合更可以体现作者思考的连贯性。2. 此外,作者对前沿技术的敏感也让人惊讶。想到这篇文章要在22年3月投稿,而gpt3在20年6月才首次发布beta版本。要在很短的时间内把一项尚不成熟的技术用于解决跨学科问题,作者的技术嗅觉真是很准确也很超强啊。
最近一周时间在上海、深圳、北京见了近20位一线AI从业者,其中包括投资人,大厂AI业务&模型厂&应用厂的员工,独立开发者,founder。很累,收获也很多。总结一下我觉得重要的共识和非共识,以下内容没有优先顺序,想到哪写到哪:

1.关于竞争:大厂、模型厂、应用厂
大厂没有逃脱局部兵力不足的问题,越是铺得广的厂这个问题越严重,字节的遍历填格子打法在业务相似度低的时候是人才密度不够的,战术上重视就行。反而阿里的通义因为更研究院模式,没有主核,分布式创新使得反而跑出来一些模型和应用侧有意思的东西,这个很值得大厂内部思考一下。
模型厂基于GPT-5迟迟不到,可能也判断出了,算力未必是万能解药,开始卷差异化,差异化对于tob的竞争尤为重要。但国内的模型厂还有一个不得不卷应用的任务,但不基于模型差异化的应用很难卷出用户体验增量,各位厂里的小伙伴都在努力地拉齐共识和内部创新的过程中。
应用厂,AI搜索的共识形成得太快了,其实没有留下太多保护期,大明牌的卷度会很激烈。反而是AI+every thing因为去年的过分乐观到今年的幻灭,留出了大量的创新保护窗口,给不迷信AI解决一切问题,但试图先用AI对具体领域做一些用户体验提升的公司留下了机会。
额外补一个硬件厂,世界上还有大量的数据没有被搜集,每个带有数据收集器的硬件厂都有属于自己的机会,但硬件厂目前很少有软硬一体的能力。补齐短板的玩家会可能会跑出来新东西。

2.关于模型能力
GPT-4o展示了快非常重要,快是核心体验之一,那么moe就必须得卷了,groq这种加速的基建也会变得非常有价值。如果大规模的智力代差比如3.5->4不会卷得那么快的话,代差之间可能更多是成本和速度的竞争。
长上下文很牛,但低成本的长上下文才有意义,基于长上下文成本急剧下降这个假设,能解决很多当前的用户体验问题。
多模态暂时在应用层的优势不明显,不考虑终态世界模型之类的,当前可能主要体现在一些之前没覆盖到的小CV场景。
fine - tuning不是净提升,是某类问题解决的更好,但通用问题更差的trade off,可以通过调整尽量降低负面影响,但从技术成本和数据成本来考虑,暂时很难作为可普及的常用武器库。
更细分的卷法,卷RAG,卷function call,卷代码能力,卷交互理解,卷情绪理解等等
可能真正值得卷的是意图识别,意图识别才是ai的推荐系统。

3.关于投融资
国内目前的情况是:创业者说市场温度低难拿钱,投资人说好项目少没法投。回到本质还是大家想用钱干什么,如果是为了加速市场形成,烧出一个煊赫盛世应该是不太可能了,因为各有各的难处,但如果真的想要构建一个未来5-10年在AI世界有独特社会分工的企业,大家还是很认可的。但目前市面上能持之以恒解自己的题的人很稀缺。
海外听到了多种说法,鉴于没有一手信息就不评价了,但如果做海外市场,还是建议谨慎考虑融资动作。

4.关于用户需求
PMF对还是TMF对?还是前者对,但现在加了一层技术可行性的约束,使用门槛很高,但体验提升巨大,也有机会。
工具效率/工作流,这是目前AI落地得最好的部分,但目前最大公约数已经挖完了,而AI目前远达不到数字员工的级别,很长一段时间基于某个职业的AI工作流copilot应该都是主要落地形式。tob和toc在这个领域都能持续跑出来赚钱的东西。
情感陪伴/内容消费,成本下不来,质量上不去,商业模式讲不清楚(付费逻辑只有hs内容能跑通,免费逻辑留存一直上不去)。

AI也不是唯一主线,AR眼镜等硬件对原本手机场景的分割,电话、拍照、翻译。还有web3。基于满足用户需求来思考,AI未必是唯一的锤子。

5.关于长期主义的优劣势
这回出来有一个比较深的感受是,基本上可以把founder分为偏长期主义和不偏长期主义两类,而这两类似乎都有其生存空间和价值。
因为我的个人偏好,所以说明一下长期主义的优劣势:
优势是,长期主义在各类决策上,难度都会降纬,因为长期主义代表你对于未来世界是有一个大概想象的,你知道五年之后想要什么,所以对于判断做什么不做什么会变容易,对于招谁不招谁也会变得容易。单一目标的决策总是比多目标的决策好做。
劣势是,早期找PMF切入点可能会非常难且漫长,对于耐力、定力和资源的要求会更高,是的,长期主义是更消耗资源的,因为反馈周期会更长。
实践了一把用爷爷奶奶的老照片做出高质量的视频,家里人都很开心,感谢技术
快手再放大招!可灵真成世界第一视频生成模型了。

发布一系列重磅更新:

基础模型升级,生成更高分辨率的视频
增加首尾帧控制
增加运镜控制,还有自动大师运镜
Web 端上线,限时免费

新模型的运动幅度和清晰度完全可以跟Gen3对标,同时美学表现也获得了提升。

控制方式更是吊打现有DiT模型。

Web端地址:https://klingai.kuaishou.com/

Invalid media: video
一张照片生成你的哈利波特入学照 !
H5 做好啦!点开链接,上传照片可以直接玩~
用自己的电脑做服务器给大家玩一天 (。>∀<。) 每个人只能玩一次哈!周天下架。https://tt.9syun.com/app/index.php?i=66&c=entry&do=mobile&m=tech_huise&r=index.index.index&state=123#/pages/detail/detail?id=460
一张照片出霍格沃茨魔法日报视频

设计 & 工作流 by @Simon阿文 :https://openart.ai/workflows/profile/ladybird_musty_24?sort=latest

Invalid media: video
今天去WAIC,展会上最热闹的就是人形机器人,但是我看了一眼就没兴趣了,所有的人形机器人要么是在后背加了悬吊,要么被固定在架子上,这是人形机器人还是机器残疾人?
看到说WAIC上有25款人形机器人,这个数据属实超出我的预期,这可是10亿级别投资的赛道,已经这么卷了,最后会剩下几家?
另外,再次表达我的一点小想法,具身真的不一定要人形。首先应该是两个应用场景,一个是生产,一个是家庭,生产领域有自己的环境特征,可伸缩的机械臂+运动机构应该可以解决大多数问题,而在家庭中,首先不能在太强存在感,所以不能太大,太像人,有恐怖谷问题,另外,头部位置为了信息输出,应该是一个屏幕,同时运动机构不一定是双腿,移动轮式就可以解决大多数的问题,总之我猜测第一个大量进入家庭的很可能长得不是人的样子。
嚯,成了前二十里唯一一个自媒体...
感谢大家
.jpg
580.7 KB
我早上离开家开启的扫地机器人,下午5点告诉我机器人失联了,刚回到家发现这一幕。
麻省理工这本《理解深度学习》的免费书可太好了。

深入讲解了深度学习的大部分概念。

而且每个章节都有搭配的PPT可以下载,还有对应练习的Python代码。

内容包括监督学习、神经网络、损失函数、正则化、卷积网络、Transformers、扩散模型、强化学习等。

这里下载PDF和课件,页面上还有更多分支的学习路径和资源:https://udlbook.github.io/udlbook/
把 Season You 做成了 H5,欢迎大家来玩,最多可以玩两次哈,今天晚点回家后我就下架啦!https://tt.9syun.com/app/index.php?i=66&c=entry&do=mobile&m=tech_huise&r=index.index.index&state=123#/pages/detail/detail?id=406
【热品】割草机器人具有多方面的优势,主要包括效率高、节省时间和自动化程度高等特点。这些设备可以快速高效地完成割草任务,无需人工干预,从而节省用户维护花园的时间和精力。此外,割草机器人还具有操作简便、安全性高、无噪音和智能化程度高等优点。
在市场方面,割草机器人在中国和全球市场都有较大的发展潜力。根据统计,2022年全球割草机器人市场销售额达到了17亿美元,预计到2029年将达到44亿美元,年复合增长率(CAGR)为14.2%。中国市场在过去几年变化较快,预计未来几年将继续保持快速增长。欧洲市场也占有较高的份额,主要由于该地区存在主要制造商和建筑活动的增加。
这个《玫瑰的故事》的 PPT,真的只花了我1分钟。

AI自己生成大纲,AI自己排版,AI自己生成详细内容……

1、

而且,模板是可以换的,整套配色也是可以换的,大纲内容是可以改的;每页 PPT 里的文字、图片和图标,都是可以调的。

所以,哪怕我需要把全部内容改一遍,因为有了下图的“靶子”,改起来,也花不了太多时间。

更棒的是,整个过程,没有花一分钱。因为,每个账号下,有9个PPT 的免费额度。

也有不限额度的AI,只不过,PPT模板相对没那么好看。

2、

下图的AI,就是99块钱一年的AiPPT(链接:猿猴学会使用工具成为了智人,你学会使用AiPPT,1分钟生成精美PPT!点击立即体验↓↓
https://m.aippt.cn/api/share/page?utm_unit=MCZZ&code=d839a2fbd5

之前看他们老板分享,还以为做出来效果,会特别 low。但今日一见,已经能对付很多场景了。

这些年我见过的年中汇报 PPT 里,比它好看的真不多。

3、

AiPPT的设计感很强,但模型能力远不如【免费的】「讯飞星火-讯飞智文」agent。

比如都输入《玫瑰的故事》,后者明显能写出更多黄亦玫的细节。

此外,讯飞智文不仅生成速度快,不付费也能下载到本地,感兴趣可以试一下:https://xinghuo.xfyun.cn/desk

4、

上次年终汇报的时候,我试着用Gamma梳理过。gamma链接:https://gamma.app/signup?r=5gesmvu4uy95nkg

短短半年时间,国产AI 开始长成了我想要的样子。不得不承认,在AI 生成 PPT 方面,我还是低估了国产AI。

为了写这篇文章,我又去搜了一下,发现iSlide 的AI 模板功能,也能【免费】实现AiPPT 的设计感:https://www.islide.cc/ai-beta

5、

最后,从三大维度做一个排名吧:

①流畅度和生成速度:讯飞智文>AiPPT>iSlide

②设计感:AiPPT>iSlide>讯飞智文

③成本:AiPPT>iSlide = 讯飞智文
Back to Top