关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Midjourney 早上发布了一个新功能,挺好玩的。

可以基于提示词生成完全随机的图像风格。

使用方式:在提示词后添加 --sref random,如果找到了喜欢的风格可以通过 --sref url 将风格迁移到新图片上。

下面是/imagine a field of flowers --sref random运行 64 次的结果。
llBs6h1JV-sz4aMa9CA2izJpJAF4v3.webp
8 MB
今天和团队一起肝了两周的豆包客户端 AI 划词功能终于上线了,她能帮你在选中文字后能提供AI 搜索、翻译、解释、总结等各类 AI 辅助功能,让桌面上的其他应用都提前接入 AI 。 当前完全免费,大家阔以来试试,给些反馈...
下载地址:https://www.doubao.com/download/desktop
顺丰的机器人打电话这么先进了吗?是可以对话的那种,我猜应该是抓取了关键词?
刚给我打电话,我一听是机器人本来想挂的,但是又怕他一直打,机器人问我快递员没联系上我,是否继续联系我配送,我以为会给个是or 不是,然后按1or 2 的选择,但是没有,它就等着我回答,我就说放快递柜,它竟然说:好的,之后会帮您放快递柜?
llamaindex的创始人分享了用llama3做100%本地化RAG的教程
很适合企业级LLM应用的落地
微软上周的一篇论文,深入探讨了AI智能体的最新实现进展。

对 Agents 有兴可以看看,一篇论文了解 Agents 。

详细介绍了 Agents 的主要分类、定义以及设计 Agents 系统的时候需要注意的问题。

✱ Agents 的分类:

单一Agent架构:这些架构由一个语言模型驱动,并将自行执行所有推理、规划和工具执行。

多Agent架构:这些架构涉及两个或更多代理,每个代理可以利用相同的语言模型或一组不同的语言模型。这些代理可能可以访问相同的工具或不同的工具。每个代理通常有自己的人物形象。

多Agent架构又可分为垂直架构和水平架构:

垂直架构:在这种结构中,一个代理人充当领导者,其他代理人直接向他们汇报。

水平架构:在这种结构中,所有代理都被视为平等的一部分,并参与关于任务的一组讨论。

✱ 有效Agents的两个关键考虑因素:

推理和规划:

AI代理要有效地与复杂环境互动、做出自主决策并在各种任务中协助人类,它们需要强大的推理能力。

规划,需要强大的推理能力,通常分为五种主要方法:任务分解、多计划选择、外部模块辅助规划、反思和完善以及记忆增强规划。

有效工具调用:

代理抽象相对于提示基础语言模型的一个关键优势是代理能够通过调用多个工具来解决复杂问题。

这些工具使代理能够与外部数据源交互,从现有 API 发送或检索信息等。需要大量工具调用的问题通常与需要复杂推理的问题相辅相成。

论文地址:https://arxiv.org/abs/2404.11584
帮一百个国家建立模型 – Stability.AI争议CEO的野望

自从传出Emad辞职起我就对他未来做什么充满了好奇(以及想看能不能投点)。几周前我们联系上了Emad,大家一起讨论了一下去中心化AI,之后我又研究了他的过去的一些发言,最终整理出了这些东西。

TLDR -
AI作为下一个时代最重要的基础设施,不能由少数机构掌控。
每个国家都需要自己的国家AI,否则会面临文化消失的风险。
Emad会启动一系列公司,作为BootLoader去启动一个个国家和行业的AI模型。
国家AI对应国家数据集,它应由集体参与,凝聚集体智慧,被集体治理。
这个方式很难追求AGI,但足够作出好用的开源小模型,极大削弱单一大模型的统治地位。
小模型是私有化部署的关键。当个人也能很轻易的把出色的模型部署在手机和电脑,我们就迎来了一个平权的AI时代。
Web3技术是这一切成为可能的关键。
具体怎么做,我猜Emad自己也还没琢磨清楚并形成清晰的执行计划。
最近做 AI 产品的独立开发者和小团队越来越多,很多朋友完全凭借自己的直觉做产品,做完发现没有人买单或者没有热度。

红杉发布的这篇介绍如何找到产品与市场的契合点文章很适独立开发者和初创公司阅读。

文章提出一个创业公司PMF的框架:紧迫需求、根深蒂固、未来愿景三种路径。理解自己在哪条路上,有助于明确策略重点,找到突破口。

找到 PMF 的三个策略,完整的翻译在后面:

◆ 紧迫需求(Hair on Fire)

你解决了顾客的一个明确且迫切的需求问题。需求非常明显。因此,你所在的领域可能竞争激烈,众多竞争者争夺市场份额。顾客在积极对比现有的解决方案。要在这种动态中突围,你必须提供卓越的解决方案,而且这些产品因其独特性而脱颖而出,不仅仅是更优秀。你不能仅仅更快或更便宜——你需要提供一个真正有区别的客户体验,以保持持久的竞争优势。

◆ 根深蒂固(Hard Fact)

你将一个普遍认为是生活中不可改变的硬事实视为一个可以通过你的产品解决的问题。顾客已经习惯了与问题共存,不再急于寻求解决方案。现状被视为理所当然,看似无法改变。你通过一个意外的方法来改变现状:事实虽难以改变,但问题可以被解决。挑战在于打破习惯的力量。顾客需要改变他们现有的行为,而这种惯性非常强大。你需要的是一个足够新颖的方法,解决一个足够重要的问题,这样的改变才值得尝试。

◆ 未来愿景(Future Vision)

你通过前瞻性创新为顾客开创了一个全新的现实。对顾客来说,这可能听起来如同科幻小说——无论是因为概念虽熟悉但看似不可能实现(如利用核聚变产生廉价而丰富的能源),还是因为之前从未有人想到(如 iPhone)。

顾客或许对此问题浑然不觉,或者本能地认为这是遥不可及的梦想。无论如何,挑战都在于克服不信任:顾客必须相信你的产品代表了一个全新的范式,这通常伴随着自己的生态系统(iPhone 不仅是一种设备;它的 App Store 开辟了与互联网互动的新方式。Tesla 不只是一辆车;它是包含相机和自动驾驶软件的网络,提供了一种全新的驾驶体验)。

全文翻译及原文:https://www.guizang.ai/work/arc-product-market-fit-framework
成都清华搞采血机器人的小伙伴,
动动手指,把自己装配了ChatGPT的Buff
所谓人机器合一哈哈哈
Gorq 的 iOS 应用已经推出,支持的模型有 Llama3 8B 、 70B 、 Llama2 70B 、 Mixtral 8X7B 、 Gemma 7B 。

输出速度非常快,目前不需要登录并且免费,通过下面的testflight链接安装。

安装:https://testflight.apple.com/join/Y9X0wGsi
技术日 充电日(投资人乱入🤣🤣
特斯拉为什么坚持纯视觉辅助驾驶?

蛮有意思,想感受下全自动驾驶技术,用眼看路,用脑思考跟自然生物演化历程很相似。
在寒武纪时期生物大爆发正是因为有了眼睛的出现,从单目到双目再到双目的位置,高等生物捕食者的前方有一双眼睛👀
汽车的视觉实现方案可以移到未来机器人上面,生物体的眼睛会面临“老眼昏花”,而机器只需要更换新的摄像头升级系统就好。
机器的一双眼睛可以运用半导体制程,最终导向就是越来越小性能越强,成本也越来越低。
谷歌免费发布了一套 15 门课长达 300 小时的机器学习工程师课程。

涵盖了机器学习系统的设计、构建、投产、优化、运转和维护工作。

详细的学习内容有:

• 机器学习基础:涵盖机器学习的基本原理和方法。

• 特征工程:探讨如何有效地处理和转换数据,以提高模型性能。

• 生产级机器学习系统:介绍如何将机器学习模型部署到生产环境中。

• 计算机视觉与自然语言处理:涉及图像和语言数据的分析和应用。

• 推荐系统:讨论如何构建个性化推荐引擎。

• MLOps:聚焦于机器学习操作的实践,包括模型的部署、监控和维护。

• TensorFlow、Google Cloud、VertexAI:介绍这些工具和平台如何支持机器学习项目的开发和部署。

课程地址:https://www.cloudskillsboost.google/paths/17
感觉 flowith 的免费版(GPT-3.5)比 Perplexity 好用很多。
这再一次证明了,在应用层上 AI 之外的工程问题还有很大的挖掘空间。
“不就是一个 GPT+搜索吗?”
这个命题,从最早的 New Bing,到 Perplexity,再到今天的 flowith。
在底层模型不变的情况下,用户体验却跨越了传统搜索引擎时代几代都不止。
所以我对那些没有自己玩过 API,没有试着自己搭建过工程,只体验过终端 to C 产品的一些 AI 专家说“现阶段做不到”或“这一轮 AI 其实做不到”信不了一点。
Back to Top