关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
AI 真的在极大地改变教育行业
以前物理学的图表都是静态的,需要自己想象
现在有了 AI,图表动起来了,学生学物理变得容易多了
Arxiv 论文: https://arxiv.org/abs/2405.18614
Invalid media: video
以前物理学的图表都是静态的,需要自己想象
现在有了 AI,图表动起来了,学生学物理变得容易多了
Arxiv 论文: https://arxiv.org/abs/2405.18614
Invalid media: video
- AI生图+美甲
- AI生图+冰箱贴
- AI生图+挂历
- AI生图+手机壳
....
Kimi 居然更新了语音通话模式!
今天突然发现我的 Kimi 上多了一个按钮,点了一下发现是语音通话功能,最近集中发货啊。
试了一下效果还挺好的:
最好的一个设计是可以在语音界面展示字幕;
支持打断模式;
支持更换声音;
支持语速调节;
另外还有独特的情景模式:
一个是英语陪练,可以单词跟读语法纠错和话题口语练习;
另一个是模拟面试,可以挖掘你的简历模拟面试场景。
还支持声音克隆,克隆的声音也能在语音通话里使用,我也克隆了自己的,可以在下面领取。
这里领取藏师傅的声音:https://kimi.moonshot.cn/m/tone/cs6eib9m9sk0pol7pu4g
Invalid media: video
今天突然发现我的 Kimi 上多了一个按钮,点了一下发现是语音通话功能,最近集中发货啊。
试了一下效果还挺好的:
最好的一个设计是可以在语音界面展示字幕;
支持打断模式;
支持更换声音;
支持语速调节;
另外还有独特的情景模式:
一个是英语陪练,可以单词跟读语法纠错和话题口语练习;
另一个是模拟面试,可以挖掘你的简历模拟面试场景。
还支持声音克隆,克隆的声音也能在语音通话里使用,我也克隆了自己的,可以在下面领取。
这里领取藏师傅的声音:https://kimi.moonshot.cn/m/tone/cs6eib9m9sk0pol7pu4g
Invalid media: video
写 Prompt 的过程中,对于语言,要区分两个概念: 语义学(Semantics)和语用学(Pragmatics)。
语义学认为语言的意义包含在「语言形式」之中。语用学认为语言的意义包含在「语境」当中。
英国哲学家保罗・格莱斯提出语用学的四条准则, 大家写 Prompt 时可以作为参考:
1. 量的准则(Maxim of Quantity)
所说的话不应包含多于需要的信息。比如对方只是想知道你是否有空参加会议,你只需要回答 “我有空” 或 “我没空”,而不需要详细阐述你当天的所有行程安排。
2. 质的准则(Maxim of Quality)
不要说自知是虚假的话。在交流中要保证自己所说内容的真实性。不要说缺乏足够证据的话。即说话要有依据,不能信口开河。
3. 关联准则(Maxim of Relevance)
所说的话要与话题相关联。比如在讨论旅游景点的话题时,就应该围绕景点的特色、地理位置、游玩体验等方面展开,而不应该突然谈论起与旅游景点毫无关系的股票市场或体育赛事等内容。
4. 方式准则(Maxim of Manner)
避免晦涩, 避免歧义, 简练, 有条理。
语义学认为语言的意义包含在「语言形式」之中。语用学认为语言的意义包含在「语境」当中。
英国哲学家保罗・格莱斯提出语用学的四条准则, 大家写 Prompt 时可以作为参考:
1. 量的准则(Maxim of Quantity)
所说的话不应包含多于需要的信息。比如对方只是想知道你是否有空参加会议,你只需要回答 “我有空” 或 “我没空”,而不需要详细阐述你当天的所有行程安排。
2. 质的准则(Maxim of Quality)
不要说自知是虚假的话。在交流中要保证自己所说内容的真实性。不要说缺乏足够证据的话。即说话要有依据,不能信口开河。
3. 关联准则(Maxim of Relevance)
所说的话要与话题相关联。比如在讨论旅游景点的话题时,就应该围绕景点的特色、地理位置、游玩体验等方面展开,而不应该突然谈论起与旅游景点毫无关系的股票市场或体育赛事等内容。
4. 方式准则(Maxim of Manner)
避免晦涩, 避免歧义, 简练, 有条理。
太多人坚信字节这种「极致推荐用户喜欢」就是制造正反馈的不可逾越的天花板,但有没有想过:
俄罗斯方块为啥不给用户一直推他们最喜欢的直长条?
因为人的贪嗔痴喜欢,是靠阉割来产生的。
我最喜欢钱,但银行不让我抢,支付宝不让我破解。我第二喜欢色,但公开网络都不让看黄图。我最喜欢的东西,全都写在刑法里。我只能找点代偿品。
因为得不到,所以才喜欢。
所以游戏是靠故意设计boss障碍挑战,才让虚拟宝物有了价值。
如果你能设计生成障碍,你就能制造更高的正反馈,因为正反馈本就取决于行为前后GAP高度反差
俄罗斯方块为啥不给用户一直推他们最喜欢的直长条?
因为人的贪嗔痴喜欢,是靠阉割来产生的。
我最喜欢钱,但银行不让我抢,支付宝不让我破解。我第二喜欢色,但公开网络都不让看黄图。我最喜欢的东西,全都写在刑法里。我只能找点代偿品。
因为得不到,所以才喜欢。
所以游戏是靠故意设计boss障碍挑战,才让虚拟宝物有了价值。
如果你能设计生成障碍,你就能制造更高的正反馈,因为正反馈本就取决于行为前后GAP高度反差
上海交通大学开源了一个非常牛批的语音生成模型 F5-TTS。
刚好这几天AI音频和播客火爆,这下瞌睡送枕头了。
模型特点有:
零样本 (Zero-shot) 声音克隆
速度控制(基于总时长)
可以控制合成语音的情感表现
长文本合成
支持中文和英文多语言合成
在 10 万小时数据上训练
最重要的是支持商用
论文:https://arxiv.org/abs/2410.06885
模型下载:https://huggingface.co/SWivid/F5-TTS
演示Demo:https://huggingface.co/spaces/mrfakename/E2-F5-TTS
项目地址:https://github.com/SWivid/F5-TTS
刚好这几天AI音频和播客火爆,这下瞌睡送枕头了。
模型特点有:
零样本 (Zero-shot) 声音克隆
速度控制(基于总时长)
可以控制合成语音的情感表现
长文本合成
支持中文和英文多语言合成
在 10 万小时数据上训练
最重要的是支持商用
论文:https://arxiv.org/abs/2410.06885
模型下载:https://huggingface.co/SWivid/F5-TTS
演示Demo:https://huggingface.co/spaces/mrfakename/E2-F5-TTS
项目地址:https://github.com/SWivid/F5-TTS