关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
推理速度超级快的 Gorq API 现在所有人都可以申请,文档和 Playground 页面均已推出。#ai#

这里申请:网页链接
尝试了一下Dashtoon 这个 AI 漫画生成应用,发现做的挺成熟的,该有的功能都有,可以一次性生成也给了充分的编辑和自定义空间。

国内的很多小说视频还是手工用各种 AI 工具拼凑的阶段,可以借鉴一下这个产品的实现方式,是个机会。

他的人物一致性是通过内置的非常多人物 Lora 实现的,目前来看这确实是最稳定的方案。

具体的生成逻辑是你输入大概的故事描述,他会为你生成很多个场景描述,你修改确认之后就会根据文字场景描述生成图片和漫画的对话。

这里尝试:https://dashtoon.com
在 Claude 3 发布 AI 圈的狂欢中,Web 3 的朋友们也吃得饱饱的,BTC涨到了 67000。
开通了Claude Pro尝试了Claude 3 Opus,我拿他主要做了三个测试,确实很强。#claude3##ai#

首先用宝玉的翻译提示词尝试了一下复杂英文内容的翻译,Claude 比GPT-4做的好,他会主动对没有排版的内容进行分段和排版时其更加的易读。
之前GPT-4从来没有主动进行过这种操作。翻译结果也比GPT-4更加顺畅。

然后我用一个样式比较复杂的设计稿组件截图让他还原,在我强调了需要还原样式之后,他对样式细节处理的非常好,相当接近设计稿了,GPT-4之前一直搞不定设计稿细节。

最后是多模态,我找了一个论文的一部分让他解读,分析的也很清楚,不过给出的信息没有GPT-4丰富,感觉多模态还需要加油。
[解读] 马斯克起诉Sam Altman、Greg Brockman及相关OpenAI公司实体

/imagine Donating to a non-profit whose asserted mission is to protect the Amzaon rainforest, but then the non-profit creates a for-proft Amazonian logging company that uses the fruits of the donations to clear the rainforest. That is the story of OpenAI, Inc.
马斯克起诉Sam、Greg及OAI,到底怎么回事?事情要从混乱善良的Musk创办中立善良的OpenAI, Inc.讲起...关于此案,整理了可能是全网最完整的complaint解读,万字长文带您了解始末。
Anthropic发布了Claude 3模型,当然,从测试结果来看比GPT-4强很多。#ai#

该系列包括三种最先进的型号(按功能升序排列):Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus。支持100万Token上下文。

你现在可以在Claude开通Claude Pro使用最强大的Claude 3 Opus模型。

详细介绍:

Haiku是市场上智能类别中最快速、最具成本效益的模型。它可以在不到三秒的时间内阅读一篇arXiv上信息密集、数据丰富的研究论文(约10,000个标记),包括图表和图形。

对于绝大多数工作负载,Sonnet比Claude 2和Claude 2.1快2倍,并具有更高水平的智能。它擅长需要快速响应的任务,如知识检索或销售自动化。

Claude 3型号具有与其他领先型号相媲美的复杂视觉能力。它们可以处理各种视觉格式,包括照片、图表、图形和技术图解。

Opus、Sonnet和Haiku更不太可能拒绝回答接近系统底线的提示,相比以往的模型,克劳德3模型表现出更加细致的请求理解,识别真实伤害,并且拒绝回答无害提示的频率大大降低。#ai#

与Claude 2.1相比,Opus在这些具有挑战性的开放性问题上的准确性(或正确答案)实现了两倍的改进,同时也展现出了降低的错误答案水平。

所有三个模型都能够接受超过100万个标记的输入,可能会向需要增强处理能力的特定客户提供这一功能。

Claude 3模型更擅长遵循复杂的多步指令。它们特别擅长遵循品牌语调和响应指南,并开发用户可以信任的客户体验。此外,Claude 3模型更擅长生成流行的结构化输出,如JSON格式。

Opus和Sonnet现已可在API中使用,该API现已普遍可用,使开发人员能够立即注册并开始使用这些模型。Haiku将很快可用。

详细信息:网页链接
通用大模型初创项目MiniMax正在进行新一轮大规模融资,阿里为其中的核心领投方。

不知道这一轮融资额跟月之暗面比怎么样。#ai#

来源:网页链接
今儿看炼丹论文,发现一篇文章引用心理学里的Social Affordance的概念来实现人形机器人和人的交互。可能我心理学白学了,读了两遍没搞明白这论文在干什么🤣🤣
AI对齐主义有个观点是对的,就是人类首先要比AI聪明,才有能力去判断AI做的事情是不是对的。延伸到现在很多利用AI贩卖焦虑的课程上,似乎有了AI加持之后就可以直接起飞,获得近乎无限的生产力,开启海阔天空的变现之路。事实上,无论是通过AI来写文章还是做视频,使用者本身的能力其实要比工具重要太多,这会体现在驾驭表现上。说直白点就是,如果你自己没有创作的基本功乃至审美、网感这些加分项,那么给你再优秀的AI,你生产出来的也只会是网络垃圾,无法带给你想要的回报,而你大费周章之后也会百思不得其解,最后得出结论:唉,AI还是不行!
尝试了一下Dashtoon 这个 AI 漫画生成应用,发现做的挺成熟的,该有的功能都有,可以一次性生成也给了充分的编辑和自定义空间。#ai画图#

国内的很多小说视频还是手工用各种 AI 工具拼凑的阶段,可以借鉴一下这个产品的实现方式,是个机会。

他的人物一致性是通过内置的非常多人物 Lora 实现的,目前来看这确实是最稳定的方案。

具体的生成逻辑是你输入大概的故事描述,他会为你生成很多个场景描述,你修改确认之后就会根据文字场景描述生成图片和漫画的对话。后两张是我一次性生成的漫画。

这里尝试:网页链接
Beeble AI和纽约大学一起发布的论文,支持一非常低的成本让人物同虚拟环境的光照相融合,效果看起来非常好。#ai#

他们最新的模型还支持从图片和视频中提取非常丰富的深度信息,可以从单个图像中提取反照率、法线、深度、粗糙度、镜面反射和照明等信息。

论文简介:

我们提出了一种新的人像重照明技术——一种融合物理指导架构和预训练框架的协同设计方法。这种方法基于库克-托伦斯(Cook-Torrance)反射模型,我们精心设计了架构,从而能够精准地模拟光线与物体表面的交互效果。

此外,为了解决高质量光源数据稀缺的问题,我们还开发了一种自我监督的预训练策略。通过这种结合了精确物理建模和扩展训练数据集的创新方法,我们为提高重照明效果的真实感设定了新的标准。

论文地址:网页链接歸藏的AI工具箱的微博视频
先别吹sora,ComfyUI+SVD才是你2024年必须掌握的ai视频工具!

周末把comfyui +svd的教程又简化了一下。

操作起来更加简单了,还是图生视频的思路,有兴趣的可以冲。
Vercel昨晚推出了 AI SDK 3.0 ,其中这个生成UI的功能太强了,比之前的V0进步非常大。

比如下面这个演示,可以生成股票交易中的所有可交互组件。感觉很快会有在聊天机器人中展示自动生成组件的产品。

这里试试:https://sdk.vercel.ai/demo
技术发展给公司和组织也带来了「Scaling Law」。

一方面随着AI工具能力越来越强,使用越来越便利,小团队的创造力可能会越来越强,比如说Midjourney实现一亿美金ARR的时候只有十几个人,SORA团队只有13个人。甚至Sam Altman表示可能出现一个人的独角兽公司。其实类似的情况在互联网快速发展的时候也出现过,新技术可以给小组织加很大的杠杆。Instagram被10亿美金收购的时候只有13位员工,WhatAPP被190亿美金收购的时候只有50个左右的工程师。而Gmail也是Google员工在20%灵活时间开发出来的。

另一方面新技术往往可以让更大更多样性的组织变得可能。线上通讯和协作工具让大规模跨国公司效率也提高了,AI显然也可能带来进一步的提升。例如字节内部有一批同声传译用于跨国视频会议时候的翻译,但显然随着AI技术提升,完全可以展望很快我们在视频会议的时候就可以自由选择要听什么语言的音频,每个人都可以听到自己母语的实时音频流了,这势必会把跨国公司的管理能力进一步加强,让更大更强的组织成为可能。

互联网时代的新巨头崛起时,如Google、Amazon、Facebook、Tesla、阿里、腾讯、美团、字节、拼多多等,往往都在组织和文化建设上有很多特点和创新,有时候是创始人个人特点使然,有时候来源于团队的思考和规划。创业者如果致力于成为AI时代的新巨头,这样的思考规划也是必备的。
Back to Top