关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
我也转投 Claude 的付费会员了,在写代码这个需求上,目前的确 Claude 更好用。
前半年,我看到的有趣的 AI 产品

前天晚上,团队和 AI 产品经理黄钊做了一次直播,聊了聊近半年的 AI 产品趋势。今天这篇文章是我对直播内容的总结,其中部分观点来源于黄钊。希望对你有启发。

1、这半年脉冲式的小爆款 AI 产品,时不时出现。之所以叫脉冲式,还是因为它们来得快,去得也快。比如去年的妙鸭相机、哄哄模拟器,今年的粘土特效、音乐生成、已故亲人的照片合影等,都是火一阵,然后被人淡忘。它们不持久原因主要还是需求点本身低频或非刚需,噱头价值衰减。

2、包括写周报之类的场景,慢慢也没人提了。AI 发展的这一年,我们见了很多噱头式的功能,但稍微拉长点时间维度看,噱头几乎没有意义。如克⾥斯坦森所说,“⽤户并⾮是在购买产品,⽽是将产品带⼊⽣活,以完成某个任务。”仅仅只是出于好奇体验某个产品,和有具体的任务可以使用产品,两者哪个有持续性,不言而喻。

3、AI 搜索类的产品,前半年也有小小的破圈。比如国内的秘塔搜索,MacTalk 推荐过几次,确实很好用。它极大程度提高了搜索的效率。但目前看,这个赛道还是比较小,一方面,它和智能助手的功能有重合。另外一方面,互联网搜索、手机上的触屏交互,已经能解决 80% 的头部高频需求场景了.....

4、所以,AI 搜索很可能只是一个过渡态的产品,包括秘塔搜索,也还在不断进化之中。最近它上线了学术搜索的功能,我估计能圈一波小众、对专业知识有要求的用户,但想扩散到更广泛的人群,挺有挑战。颠覆搜索的,大概率不是另一个搜索(Perplexity 的前景,我还没看懂)。

5、很多人不理解AI虚拟陪伴聊天应用的价值,虽然最近Character.ai最近被爆资金链断裂,但我仍然不怀疑这类产品的价值。很简单,00 后、10 后用户在精神方面的需求,和 70、80、90 这几代人完全不同。

6、跨语言,可能是大模型最Native、现阶段最容易被感知和落地、但又最容易被忽视的能力。比如纳瓦尔的 Airchat,有一个能力是模仿用户的音色,自动完成语音翻译。还有一款 ToB 的产品,它可以帮助出海公司快速将当地法律法规情况翻译、整理成母语。Spotify也推出AI语音翻译功能,“让你喜欢的博主用你的母语为你播报”。

7、a16z 今年把语音 AI 作为一个独立投资主题。最近,AI 语言学习产品 Speak 完成了2000万美元B-3 轮融资,估值已经达到 5 亿美元。这个产品也是跨语言,只是人家场景进一步具体化了。Speak官方博客中透露:韩国有将近 6% 的人在使用 Speak 学习英语。

8、语音/音频确实是一个值得重点关注的方向,我的感觉是随着 AI 技术的成熟,它可能会迎来大爆发。比如最近我体验的产品 PocketPod,它可以根据用户的兴趣,定制生成播客。还有 Hume AI,今年也拿了好几轮融资,它可以根据人们的声音解释情绪。

9、从生产和消费信息的角度看,说话比打字快,读比听快。AI 完全可以帮我们完成语音和文字之间的转换。今天,墨问便签发布了 AI 语音笔记,你可以试试。之前很多人说自己不会写,但能说,那你现在可以说了,AI 帮你转换为可读的文字。

10、AI Agent 虽然很火,但到目前为止,仍然没有特别好、真正跨过那条“金线”的 Agent 产品。因为目前还缺很多很多东西,表层看,缺少推理能力、记忆、使用工具等能力。深层看,还缺少机器和机器(Agent 之间)通信和交互的底层架构和机制(这块,可以看看 Exa AI,一个针对 AI Agent 构建的搜索引擎)。

11、阿里最新推出了Mobile-Agent-V2,这是一个具有视觉感知功能的自主多模态移动设备代理。简单来说,它能理解指令,然后自己识别手机屏幕内各种元素和按钮,执行操作。比如,让它打开小红书搜索某个关键词,AI 能找到小红书,再找到搜索入口,进行搜索。LLM + RPA,是短期落地 Agent 的最佳姿势。

12、盘盘单词(小程序)这款产品是百度网盘团队出品的,让人眼前一亮。它能够从百度网盘里检索图片,然后在图片上打单词标签,帮用户学习。比如一张草原上的照片,它会标注出来草原、天空、马、云朵的英文单词是什么。

13、目前我用到的 AI 产品,更多还是集中在生产力工具层面。我们可以看到,过去一年中,剪辑工具、图片工具、内容生成工具,它们集成 AI 时,也会比较自然。这周,我看到剪映还推出了一个 AI 能力:智能剪口播,它可以直接提升剪辑视频的效率。

14、美图这家公司的产品你可以看看,它们这两年探索了很多 AI 应用。前两天我看了一篇采访,美图 CEO 提到两个观点:1)总结所有失败的产品,共性第一个是赛道没选对,第二是如果赛道选对了,在赛道里面的需求点以及切入点有没有选对。2)你要服务的用户,需要非常清晰,这样你才能精准地触达,针对性地建立心智。与其大而全,不如选择比较清晰的用户,然后逐步建立心智。
卡兹克的公众号推送已经只有各家ai厂商的公关稿了……
看了一会央视 6 套的电影《我,机器人》,威尔.史密斯开车在隧道被机器人袭击,他的上司和女性朋友见到他第一时间都带责备口吻说了“你没有使用自动驾驶?”。
自动驾驶不可阻挡的来了。
电影是 2004 年上映的。
昨晚11点多给自己的网站接上了Stripe的订阅,不到1小时就出了第一单,心里非常开心,从此有稳定的MRR收入,不再是一次性买卖了

结果刚刚四点多又醒了,失眠睡不着,惦记着有没有新来多几笔的订单

记得前段时间自己定了个计划,最近一个多月(到8月结束前)不要想赚钱的事情,而是先把基础打扎实(学好需求挖掘、SEO推广、Coding等等)

每做一件事情前,先想想未来三个月以后,它能否还能对我产生价值,而不要去关注短期这每天几十美元的波动

计划是定下来了,但执行起来还是很困难,心里还是会忍不住地去想今天的收入是多少,订单少了一两单是为啥

看来很多道理嘴上说着都很简单,但还是只有真的下场做事了, 才知道是那么地不容易,而心态和能力也只有在这一点一滴的实践中才能慢慢磨练出来
人形机器人有啥用?
AI探索指南
🌋 超重磅:Meta 正式推出开源的Llama 3.1,现在人人都可以拥有GPT-4o水平的大模型 Llama 3.1 405B 在多项重要基准评估上, 甚至超越了Claude 3.5 Sonnet和GPT-4o,在常识、可转向性、数学、工具使用和多语种翻译等一系列任务方面,与领先的封闭源代码模型相媲美。 🐑 正式介绍 Llama 3.1 Llama 3.1 405B 在超过15 万亿个代币上, 1万6千张 H100 GPU 显卡训练数个月,这也是有史以来第一个以如此庞大规模的 Llama 模型。 …
升级版 Llama 3.1 8B 和 70B 型号也是同类产品中的佼佼者,这些较小的型号同样支持经过改进的 128K 标记上下文窗口、多语言性、改进的推理和最先进的工具使用.

新一代的 Llama 将点燃新的应用和建模范式,包括生成合成数据以改进和训练更小的模型,以及模型提炼--这是开源软件从未达到过的能力。

Mark Zuckerberg 在一封公开信中表达:我们相信,开源将确保全世界更多的人能够享受人工智能带来的好处和机会,确保权力不会集中在少数人手中,确保这项技术能够在全社会得到更均衡、更安全的应用。 这就是为什么我们继续在开源人工智能成为行业标准的道路上迈出步伐。

🔗 访问 Llama 3.1

通过 WhatsApp 和http://meta.ai/ (美区),你可以第一时间体验到 Llama 3.1 405B。(评论区持续更新第三方平台地址和评测)

更多模型相关信息,参见官网 https://llama.meta.com/
🌋 超重磅:Meta 正式推出开源的Llama 3.1,现在人人都可以拥有GPT-4o水平的大模型

Llama 3.1 405B 在多项重要基准评估上, 甚至超越了Claude 3.5 Sonnet和GPT-4o,在常识、可转向性、数学、工具使用和多语种翻译等一系列任务方面,与领先的封闭源代码模型相媲美。

🐑 正式介绍 Llama 3.1

Llama 3.1 405B 在超过15 万亿个代币上, 1万6千张 H100 GPU 显卡训练数个月,这也是有史以来第一个以如此庞大规模的 Llama 模型。

作为最新版本的一部分,Llama 还推出了 8B 和 70B 型号的升级版本。这些模型是多语种的,上下文长度答复增加到 128K,整体推理能力更强。

💪 强大的Llama 3.1 405B ,媲美当下最顶级模型

在多项基准测试中, Llama 3.1 405 和GPT-4o、Claude 3.5 Sonnet 相当或超越。

Llama 3.1 405B 胜出任务和基准评估,具体有:

- IFEval (88.6),它评估模型在If-Then推理任务中的决策制定和情景分析等能力。

- GSM8K (96.8) ,它评估了模型解决小学到初中水平数学应用题的能力,反映其多步骤推理和执行基础数学运算方面的强大能力。

- ARC Challenge (96.9),它测试模型回答需要因果推理、逻辑推理和抽象思维的多选题的能力,表明模型具有强大的推理和常识理解。

- ZeroSCROLLS/QuALITY (95.2,与GPT-4并列),它评估模型理解和分析长文本的能力,这对于理解复杂文档、报告或故事非常重要。

- Nexus (58.7) 明显优于其他模型,评估模型在复杂的推理链和知识整合任务中的表现。

- Multilingual MGSM (91.6,与Claude 3.5 Sonnet并列),测试模型在多种语言中解决数学问题的能力,展示了模型的多语言处理能力和跨语言的数学推理能力。

综合来说, Llama 3.1 405B 凸显了其在数学推理、逻辑思维、长文本理解、复杂推理和多语言处理方面的强大能,在处理需要深度思考、长期记忆和跨领域知识整合的任务时将会非常出色,对于开发高级 AI 应用具有深远意义。

🌳 Llama 将深刻影响全球创新生态
和群友们用 Dify 把玩 AI 自动生成封面头图中...我们这周的 Demo Week 3 准备一起优化这套 Workflow,目标:一键生成全平台文案 + 不同规格的封面头图。另外,封面是可以轻松自定义的 ~ 开箱即用,期待一下叭!
类比人来看,人形机器人的运动主要分为两类——线性运动和旋转运动,所涉及的关节和相关的组成有三类,这三类关节主要由电机、减速器和丝杠三个核心部件组成
Telegram dogs推出了签到!每天点开小程序都可以获得200的代币

按照 #bitget  目前0.013的盘前价格,大概2.6u。

领取链接
🔗 https://t.me/dogshouse_bot/join?startapp=p-_RC98MRPaJrWWO25VxcA

第一次可以领800——500个,根据使用tg的年份,没领取的赶紧领取。
一个AI相册搜索应用的两年

写了一篇很长的流水账,记录寻隐/Queryable的诞生、爆火、开源、抄袭、沉寂的故事。
中国硬件厂商对机器人的想象:接个大语言模型跟你说话,帮你干活。
日本硬件厂商对机器人的想象:不会说话,卖萌求生。
Back to Top