RSSAmplifier

Blog

多头注意力

Recent content on 多头注意力

yuanhao.siteRSS feed ↗110 posts

Latest posts

Weekly AI Observations: AI Creation Is the New Liberal Arts

Saw a concern on social media today. Where is the demand for AI? It’s both right and wrong. Demand hasn’t magically appeared out of thin air, but suppressed demand is being unleashed. I’ve had a realization lately: AI creation—coding, image generation, video generation—is like the new liberal arts of our era. Technique Is No Longer the Barrier Donald Knuth’s famous The Art…

每周AI观察:AI创作是新时代的琴棋书画

今天在朋友圈看到一个担忧。 AI的需求在哪里 这话对也不对。需求确实没有凭空冒出来多少,但被压抑的需求正在被释放。我最近有一个感悟:AI创作,包括coding、生图、生视频,就像是新时代的琴棋书画。 技法不再是门槛 高德纳那本著名的《计算机程序设计艺术》,书名本身就说明了一件事:写程序是一门艺术。好的程序不仅有用,而且赏心悦目。且不说内部实现这种有欣赏门槛的东西,一个漂亮的UI应该人见人爱。 但琴棋书画这类艺术有个特点:想要精通必须大量练习。写程序也一样。很多人想象力很优秀,脑子里有画面,但无奈技法水平有限,无法表达出自己的想象。 我是个后端工程师,之前不太会开发网页应用。但我自认为审美还行,能够欣赏做得漂亮的网页和设计。现在有了AI编程,我可以直接指挥它来做出一个很漂亮的前端页面。多模态能力让这件事更简单了,我可以直接截图告诉AI哪里需要修改,真的就跟和前端工程师打交道一样。…

Weekly AI Observations: User Growth for AI Products

NBot took first place on Product Hunt’s daily board. It’s a product we spent two months building and launched over the Christmas holidays. The timing was partly because of delays and partly because competition is lighter during the break. We’re happy with the result, but the whole process gave me a much clearer view of growth for AI products. Product Hunt Isn’t as Easy as It Looks Posting on PH is…

每周AI观察:AI产品的用户增长

NBot在Product Hunt上拿了日榜第一。 这是我们花了两个月做的产品,在圣诞假期期间发布。选这个时间点一方面是各种原因一直延后,另一方面假期竞争确实小一些。拿到这个成绩挺满意的,但整个过程让我对AI产品的增长有了更具体的认识。 Product Hunt没有想象中简单 在PH上发布的门槛不高,但想拿好名次并不容易。前面的产品都是花了人力物力运营的,票是要拉的。 在LinkedIn、Facebook上搜Product Hunt能找到很多群组,有的规模还不小。你在群里发要launch,会有很多做营销的人来加好友问要不要帮打广告。但PH的防作弊机制挺厉害,新账号投票不作数,需要养一段时间才有权重。这在很大程度上减少了刷票,但不是不能刷,找对圈子很重要。…

Two Weeks Off AI Notes: Starting Something New Is Hard

Life has been busy and I barely had energy to watch AI updates. I wrote half of last week’s (12.05) notes and never finished, so here comes a catch-up after two weeks away. Last week saw a bunch of new models or reports: DeepSeek, Mistral, QwenVL. I skimmed DeepSeek-3.2’s report and nothing really grabbed me; Mistral feels forced, with the only bragging point being a programming win…

两周AI没观察:做新业务好难

最近真的挺忙,都没有什么精力去观察AI了。上周(12.05)写了半截,后面没有写完,今天稍微有空再写一些。所以本期的标题是两周AI没观察。上周有不少新模型(或技术报告)发布,DeepSeek、Mistral、QwenVL都有。我扫了一眼DeepSeek-3.2的报告,没有太多我感兴趣的内容;Mistral更是感觉硬着头皮在发布,唯一可吹的是好像在开源模型里拿了个编程第一,有待社区后面验证。这些我都只是走马观花。这周GPT-5.2的传言满天飞,但到目前还没有发布,大模型竞争真的进入了白热化阶段,各家都不想输,发模型可能会稍微变得更谨慎。这些先按下不表,今天聊一聊最近感悟到的(AI)toC产品有多难。 因为要估算项目明年的各项指标,所以最近计算器快按冒烟了。我是第一次干这个事情,所以还挺有新鲜感。周末的时候干脆vibe coding了一个startup…

Weekly AI Observations: 2025 Year-End Model Selection Guide

It’s the first day of Thanksgiving break—thanks for reading. Last week’s vibe coding interview piece became my most-read article ever, thanks to Ruanyifeng for featuring it in his tech weekly. This week I want to talk about model selection for AI apps at the end of 2025. It’s critical: it drives both quality and cost. Don’t shrug off the difference between $0.20 and $0.25 per million tokens—that’s…

每周AI观察:2025年末AI模型选型指南

今天是感恩节假期的第一天,感谢各位读者的支持。上篇关于vibe coding面试的文章是我写作生涯阅读量最高的一篇,最应该感谢阮一峰老师把它收录到了科技爱好者周刊里,让它有机会出现在大家眼前。 这周想聊聊2025年末的AI应用模型选型。模型选型对AI应用来说真的非常重要,不仅决定效果,还影响成本。别看每百万token一个0.2美元一个0.25美元只差5分钱,这里面可是25%的成本差距。如果一个面试者能对现在主流的模型能力、价格、特点如数家珍,在我这里一定是个加分项。 Openrouter的参考价值 Openrouter是个不错的参考,可以看现在别人用什么模型比较多,但上面的分布和真实用量肯定有巨大差别。 Openrouter每周都有模型榜单 首先是上面很多免费token送,一免费用量就会上去,比如现在排第一的Grok 4.1 Fast…

Weekly AI Observations: Interviews in the Vibe Coding Era

Cover created with Nano Banana Our team’s interview format just changed. Leetcode puzzles are out; building a full feature is in. If you don’t code with AI—and your typing speed isn’t absurd—you won’t finish. It sounds like a tooling upgrade, but it’s actually reshaping what we mean by an “excellent engineer.” The Gap Gets Wider In classic algorithm interviews, the difference between failing and…

每周AI观察:Vibe Coding时代的面试

Cover created with Nano Banana 我们组的面试方式变了。 从写leetcode题变成让候选人实现一个完整功能。如果你不用AI编程,除非手速超快,否则根本完不成。这种改变看似只是工具的升级,但实际上正在重塑我们对"优秀工程师"的定义。 差距被放大了 原来的算法面试,写不出来和写得出来之间,可能只是一个提示的差别。但现在让你实现一个界面或一个功能,完成度可以是天差地别。 有人能在一小时内做出一个基本可用的页面,交互流畅,样式得体。有人却在和AI的来回修改中越陷越深,最后连基本功能都跑不通。同样是用AI工具,结果却大相径庭。 这种面试方式,把候选人之间的差异放大到了前所未有的程度。 沟通能力成了硬通货 在这种新面试下,沟通能力变得特别关键。不仅是和面试官的沟通,和AI沟通好同样重要。 我最近观察到一个有意思的现象:不善于沟通的人往往对vibe…

Weekly AI Observations: Linear Attention

On my commute I listened to a podcast episode featuring Songlin Yang—nicknamed the mother of linear attention—where she patiently explained the mechanics behind the architecture. The structure is red-hot right now, especially because several frontline Chinese model labs are doubling down on it. I figured it was worth retelling the story in my own words. How Is a Token Generated? To keep things…

每周AI观察:线性注意力

上班路上听了号称线性注意力之母的Songlin Yang的一期播客,小姐姐在里面科普了线性注意力的原理。最近这个结构非常火,特别是国内几个一线大模型厂商都在押注这个赛道。我觉得有必要用自己的话把这件事再说一遍。 一个Token是怎么生成的? 为了简单起见,我们聚焦在大语言模型的推理阶段——通俗点讲就是普通用户向大模型提问这个场景。假设用户问了这么一个问题:“我想元旦去看雪,有什么地方推荐的吗?“用过大模型的人都知道,接下来大模型就会开始一个字一个字地回答你。 大模型回答的每一个字,都可以拆解成以下几个阶段: 1. Tokenization(分词) 简单讲就是把人类的语言变成一串数字,每个数字都是一个编号。比如上面那个问题在ChatGPT处理前会转变成这样一串编号:[37046, 33565, 111, 24186, 6079,…

Weekly AI Observations: What Really Matters

This week didn’t revolve around a single theme. It wasn’t a neat follow-up to last week’s “product fundamentals,” nor a deep dive into “triple-speed coding” like 10.19. It felt more like a handful of scattered observations and experiments, each sparking new thoughts. If there’s a shared thread, it’s probably this: in an era where AI rewires productivity, what actually matters? Beautiful view…

每周AI观察:什么才重要

这周没有单一的主题。没有像上周那样聚焦于"产品基本功",也没有像10.19那样围绕"三倍速编程"展开。更像是几个零散的观察和实践,但每一个都让我有些新的思考。如果非要找个共同点,大概是:在AI改变生产力的时代,什么才是真正重要的? Google办公室窗外美景 当生产力爆炸,品味成为稀缺 这周去了Google三番办公室参加一个活动,虽然内容比较high level,但质量不错。他们总结了AI时代产品的几个变化,我记住了三个: 第一是意图做输入。用户很多时候不需要像以前一样亲自操作,只要把想干什么告诉产品就行。第二是多模态,模型的进步使得理解和操作非结构化数据变得前所未有的容易。第三是自动化,产品可以直接交付结果,而且能在你不使用它的时候继续为你工作,达到更好的效果。…

Weekly AI Observations: Product Fundamentals Still Matter

This week I listened to LatePost Chat’s episode “Agents Are Opportunities—and So Are Agent-Building Tools | Starting From OpenAI DevDay.” Henry, the guest, mapped out six major inflection points in the evolution of agent tooling: from ChatGPT’s launch at the end of 2022 to the recent wave of “computer use.” Every leap in model capability exposes a new “body part” that needs strengthening, and each…

每周AI观察:产品基本功依然重要

这周听了晚点聊的一集播客【Agent是机会,造Agent的工具也是|从OpenAI开发者日聊起】,感觉很好。嘉宾Henry在里面梳理了Agent工具发展的六次主要升级,从2022年底ChatGPT发布,到最近的Computer use能力,每次模型能力的跃迁都会暴露"身体"的短板,催生一波新工具来补齐。 听完之后有种connected the dots的感觉。这两年确实就是这么过来的,每隔几个月就有新的能力出来,每次都会带起一批新公司。LangChain抓住了最早的编排需求,LiveKit赶上了语音交互的浪潮,E2B、Daytona切入了代码执行的沙盒,Browserbase又站在了Computer use的风口上。 这套梳理让我想起了这几周在旧金山Tech Week见到的那些创始人。当时还不知道背后的脉络,现在一对照,才发现他们确实都是在各自的节点上抓住了机会。…

Weekly AI Observations: Coding at 3× Speed and the Counterintuitive Tradeoffs

This week a teammate and I ran a deep experiment: we handed almost the entire coding workload of a new project to AI. The outcome was stunning—we wrapped up in a single week what normally takes us three. Yet behind that unprecedented velocity were a few counterintuitive truths that quickly surfaced. The Cost of Efficiency and Cognition on Overdrive When coding hits three times its usual speed, the…

每周AI观察:当编程按下三倍速键,我们发现了这些反直觉真相

这周,我和同事进行了一场深度实验,几乎完全依靠AI编程来推进一个新项目。结果令人震撼,我们在一周内完成了过去需要三周的工作量。然而,在这前所未有的效率背后,一些反直觉的真相也浮出水面。 效率的代价与注意力的过载 当编程进入三倍速,我首先感受到的不是疲惫的双手,而是过载的大脑。任务的节奏被极大地压缩了:设计、体验、修改功能的循环快得让人应接不暇。虽然有Rate limit来让人强制休息,但当注意力频繁切换的强度也和效率一样达到了过去的三倍,这本身就成了一种新的认知负担。 我的同事采用了更极端的并行策略,他同时在三个目录上开了3个独立的工程分支用Claude…

AI Weekly Notes 251012

I tried a different workflow this week: let the AI interview me first, then spin my answers into a story. Two big moments stood out—catching the vibe coding wave with Claude Code, and feeling the AI heat in San Francisco during Tech Week. Vibe Coding Sends Productivity into Orbit Trying vibe coding wasn’t a spontaneous whim. I’ve long used Copilot mainly for inline completion, occasionally…

每周AI观察251012

这周决定换个写法,先让AI把我刚经历的一切梳理成问题,然后再把答案拼接成故事。主题集中在两个瞬间:一个是抓住 vibe coding 这股风,另一个是在三番的 Tech Week 感受到的AI热浪。 Vibe coding 让效率坐火箭 尝鲜 vibe coding 其实并不是一个突如其来的决定。之前一直在用 Copilot 当补全工具,偶尔切换到问答模式解题;Codex 则帮我撸过一些独立功能。本周被同事疯狂安利,终于认真试用了 Claude Code。真正的契机是最近开了几个需要完整端到端体验的 side project:算法做完了,总得有个前端去展示。以前这种需求我会用 Gradio 将就一下,但扩展性、体验都差点意思。现在模型写前端的能力明显升维,索性试试看。 事实证明,Claude Code 的体验的确对得起“vibe…

Weekly AI Observations 251005

Went to the Silicon Valley 101 Alignment conference today. After being a listener for several years, I finally saw Jane and Qian in person. Did not expect the scale to be this big—absolutely packed, and not just Chinese attendees; plenty of international friends too. As Xiaodi Hou said: Silicon Valley really is the promised land. The collective hunger for new tech and new chances is just awesome.…

每周AI观察251005

今天去参加了硅谷101的Alignment大会,作为好几年的听众,终于亲眼见到了Jane和Qian。 没有想到今天规模这么大,现场真是人山人海,而且不只有华人,外国友人也有不少。 就像侯晓迪讲的,硅谷就是promised land,对新技术新机会的追求热情和氛围真的很棒。 今天收获还是不少,首先是有感于自ChatGPT发布以来,他们的订阅数竟然涨了如此之多。我在前几天也简单看了一下“数字生命卡兹克”的数据,虽然没有硅谷101那么成功,但毫无疑问也是借AI东方崛起的典型代表。 作为一个打酱油的技术自媒体,以及似有若无的AI从业者,不免有虚度光阴的感觉。 另一方面,作为一个近几年都没有什么增长的内容产品参与者,心里更加不是滋味。 AI这个内容机会绝对也是对我们敞开大门甚至还蛮适合的,但我们只会竹篮打水靠运气的搞法在内容的把握和执行上真的连门都没有入。 硅谷101近几年的订阅数…

ACL ARR审稿碎碎念

ACL 2025年5月的ARR cycle已经出分了,估计这会儿学术圈又忙起来了,作者在忙着写rebuttal,AC在忙着找紧急审稿。而我这个审稿人却感觉格外的轻松,因为这次看的论文分都太低了,估计作者都不会来rebuttal,自然我也不用再回复作者。 这一次给我分的都是RAG和Hallucination方向的论文,我一共审了5篇,打分情况是3篇2分,2篇2.5分。说实话,总体上我已经抬一手了,全凭良心打的话,还要更低一点。 给不熟悉ARR评分标准的读者稍微补充一下,ARR是5分制,分以下9档: 5 = Consider for Award: I think this paper could be considered for an outstanding paper award at an *ACL conference (up to top 2.5% papers). 4.5 =…

Reflections as an ACL ARR Reviewer

The scores for ACL 2025’s May ARR cycle have been released, and I imagine the academic community is busy again—authors scrambling to write rebuttals, area chairs frantically searching for emergency reviewers. Yet as a reviewer, I feel exceptionally relaxed because the papers I reviewed scored so low that I doubt the authors will even bother with rebuttals, which means I won’t need to…

Seeing the Big Picture Through a Narrow Lens: Understanding Agent Products Through OpenManus

The recent “Dawn of the East” hype around Manus.im sparked significant attention. However, its evolution over the past few days has been dramatic, with numerous open-source projects attempting to replicate it. OpenManus, one of the earliest clones, claims to have replicated it in just 3 hours, though its parent team MetaGPT has been working on agents for much longer. I believe both…

管中窥豹:从OpenManus看到底什么是Agent产品

前几天号称“东方破晓”的Manus.im着实火了一把。但这几天的演进也充满戏剧性,已经有一大堆开源项目来复刻他们。OpenManus算是比较早的一个,号称3小时就复刻了,但其实他们背后的MetaGPT团队已经搞Agent很久了。我感觉目前的产品惊艳或者翻车都很正常,整个行业才刚开始。但OpenManus这样的项目是一个很不错的学习Agent开发的切入点,它足够简单,也覆盖了足够多的东西。这篇文章是我的一个学习笔记外加一些思考,跟大家交流。 事先说明,开源代码库变化很快,我是2025年3月7号下载的,所有内容都基于当时的版本。先来看一下整个工程的结构: . ├── LICENSE ├── README.md ├── README_zh.md ├── app │ ├── __init__.py │ ├── agent │ │ ├── __init__.py │ │ ├── base.py │…

Deepseek公开利润率带来的影响

2025年2月28号,DeepSeek开源周的第六天,官方发布了一个很特别的东西,是V3/R1模型的推理系统介绍。和前面几天的代码库不同,这次是一篇博客文章。文章我没有细看,看可能也看不太懂,但单纯是tweeter上的帖子,已经带来相当大的震撼。…

Impact of Deepseek's Public Profit Rate Disclosure

On March 1st, 2025, the sixth day of DeepSeek’s open-source week, they released something quite special - an introduction to the V3/R1 model’s inference system. Unlike the code repositories from previous days, this time it was a blog post. I haven’t read the article in detail, and I might not fully understand it anyway, but the Twitter post alone has already caused quite a stir.…

小模型 Phi 的发展之路

今天微软发布了 Phi3 模型,3.8B 的小体量做到了 Mixtral-8x7B 一样的效果,在社区引起了不小的轰动。 fuyao 老师直呼不能李姐 我前段时间曾经试过finetune Phi2 模型,效果说实话并不是很理想,默认 context 只有 2k 更是让他难以胜任很多生成式的任务。 今天发布的 Phi3 context 做到了 4k,还有长上下文的 128k 版本,至少在这块已经补上了短板。 其实 Phi 家族一直是 LLM 领域蛮有个性的一套模型,今天也趁机梳理了一下他们的发展脉络。 我们倒过去看,先总结一下今天发的最新版 Phi3。Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone的几个重点如下: 模型尺寸有3.8B,7B,14B,3.8B 性能已经不错,量化后…

生成式模型的奇葩应用:生成式检索

最近在学习一个奇特的技术,叫做生成式检索。生成式检索是一种利用生成式语言模型的全新信息检索方法。不同于依赖外部索引的传统方法,生成式检索利用单个强大的模型来处理查询和文档语料库。在这个注重推理能力,讲agent的年代,生成式检索却走到了让模型“死记硬背”的另一个极端。 生成式检索用简单的话来说,就是对于输入查询(query),让模型直接生成出语料库里相关文章的id,是的,你没有看错,是直接生成id!当然,这就会涉及到一个很重要的问题——id长啥样?当前的主流做法有几种: 原子id(atomic id),即每篇文章用一个独立的token来表示。这实际上是挂羊头卖狗肉,说是生成式,但因为每个文章都有独立token,所以等价于一个分类问题。 朴素id(naive…

OpenAI 公布声音克隆新技术,仅需 15 秒音频样本即可模仿任何说话者,将带来哪些影响?

很多答主都提到了,从技术角度来看,声音克隆技术并不新,别的不说,去年大火一阵的 AI 孙燕姿应该大家都还有印象。 「AI 孙燕姿」火遍全网,随着技术的发展,未来 AI 歌手会成为主流吗?这一技术还可能应用到哪些场景? 用孙燕姿的声音唱各种不同的歌曲就是声音克隆,而且难度还更好,因为要考虑音乐的节奏、音调、音色等因素。去年的效果已经很不错了,否则也不会出圈。更值得注意的是,AI 孙燕姿并不是某个大厂搞出来的,而是好多爱好者自己 DIY 出来的。可见,这个东西在技术上真的没有什么大的突破。 如果大家自己想玩玩 tts,我很推荐这个库,各种功能都有,自然也包括声音克隆。但开源的音色跟闭源确实没法比。 https://github.com/coqui-ai/TTS 但 OpenAI 做这个我觉得对他们自己还是很有意义的。毫无疑问,OpenAI 是要把自己打造成 AI 能力的首选,现在靠着 GPT…

来自社区的Gemma微调踩坑记录

越来越多人发现Gemma 难以 finetuned的现象了。今天在 Twitter 逛就看到好几个相关帖子。 下面这个老哥是 Dolphin 和 Samantha作者,应该算有经验的开发者,直接搞了一个 200 多的 loss 出来。 add new token引发的惨剧 后面他们发现可能是新加 token 导致的问题。finetune 时如果新加 token 必须训练 embedding,对于 lora微调来说默认是不训练这组参数的。老哥把新 token 去掉之后正常了。如果是像我一样的全参微调压根不会碰到这个问题,Lora 看起来还是在社区里占据了更主流的位置。 Teknium 也是 finetune 达人,上来loss 也很高,但后面慢慢降下去了,原因也是他加了新 token。 另一个add new token引发的惨剧 回帖里有个老哥(之前是 OpenAI 员工哦)说可能是…

地表最强7b模型?我的Gemma体验报告

昨天,也就是2024年2月22号,一早上起来就看到国内的AI公众号就热闹非凡,Google发布了他们的开源大语言模型Gemma,上Twitter也看到Jeff Dean卖力地再宣传自家的新产品:几条推文展现了好多令人兴奋的技术指标。 在上班前我先简单翻了翻技术报告,让我比较感兴趣的是256k的词表大小和6T的预训练语料。这俩改动加起来我估计应该性能确实会有一些提升。 最近Andrej Karpathy在YouTube上搞了个很火的讲Tokenizer的课程,应该也从侧面体现tokenizer和词表对现在的LLM性能之重要。我用Tokenizer…

接近参数化的世界

每个人的世界无非是ta看到的,听到的,闻到的,尝到的,摸到的加上想到的。 今天Sora的问世让我感觉到离计算机能够模拟这个感官世界已经不远了。虽然不是精确的,但肯定可以是精彩的,令人满意的。在享受面前,谁又会在意精不精确呢。 2022年ChatGPT出来的时候有模糊的感觉:预测下一个token的任务竟然能在效果上模拟推理、逻辑、甚至扮演角色,这不就说明文字世界的一切其实是被一个概率刻画的规律主宰的吗。放在玄学语境里,就是所谓的因果,它真的存在。 这次OpenAI更近一步,“世界模型”的概念已经再清楚不过地表达他们已经接近找到用概率模型刻画世界的方法了。 Sora is able to generate complex scenes with multiple characters, specific types of motion, and accurate details of the…

填志愿真难

这两天各省的高考成绩陆续发布,考生和家长马上该为怎么填志愿伤脑筋了。 今年小舅子高考,考得不错,虽然清北上不了,但其他学校应该都有机会。作为一名负责任的好姐夫,自然也发动身边资源给小舅子出谋划策。 不搞不知道,现在填志愿还真是不容易。 首先是现在的大学都很会蹭热点、造概念。人工智能相关的各种学院、实验班就有好几个,比如浙大的图领班,人大的高瓴学院,复旦的计算机科学拔尖班。 还有些近年来火热的产业比如新能源,也有像上交的博渊未来学院这种新兴院系。 近年来各种软硬件的热点确实多,AI、半导体、新能源都火过一把,给了这些院系或者项目很好的土壤。 家长和考生也很吃这套,愿意为此买单。 遥想十几年前我填志愿那会其实也有热门专业,当时的显学是金融、建筑、土木,现在好像也都比较冷清了。 所以大家填志愿的时候也不要过分追逐当下的热点。…

令人吃惊的M2芯片

最近拿到了一台14寸的MacBook Pro,搭载了M2 Pro芯片,内存为16GB。昨天心血来潮,在上面尝试训练了一个神经网络,感触挺深的。 我训练的是一个BERT-base模型,当年也算是个”大模型“,但在现在看起来就是个小不点。训练数据不多,大概一万多条文本,平均长度应该接近模型的最大输入长度。 这个任务在我的A6000显卡上跑得飞快,不到十分钟就可以跑完三个epoch的训练。我一开始移植代码到MacBook上的时候没有注意到Huggingface Trainer有个控制是否使用M系芯片神经处理的开关,所以用的是CPU,进度条显示训练完要15个小时。 后来查阅文档,打开开关后,跑完训练的时间大幅下降到了1小时左右,提速了十几倍!(测试不严谨,但提速非常大是肯定的) 别人M1 Ultra的测试结果也有明显提速…

Vicuna初体验

今天深入体验了下Vicuna,以下是我的takeaways: 指令跟随的能力跟ChatGPT有点差距。最典型的就是下面的身份设定任务都经常失败(如下图)。模型会非常倔强地回复你他是Vicuna,是LMSYS训练的模型。 针对上面的问题我看了下代码,发现他们专门搞了好几个问身份的语料来训练模型图片,真的是把身份感刻在了骨子里。 fastchat迭代挺快的,今天试了下他们新加的API功能。整个使用体验几乎和openai的client一模一样,学习成本很低。但目前文档没怎么跟上,有时需要看看代码。例如我在异步环境里用chatCompletion.create失败,看代码才知道要用acreate。 试了下Vicuna-7b的embedding,能力非常一般,而且维度4096太大了,那算相似度可真费劲,而且在检索任务上被768维的Instructor Embedding秒杀了。…

OpenAI官方出品的ChatGPT调校指南你读了吗

作为一名Prompt Engineer,每天都在跟GPT打交道,时常被他惊艳,也看过很多模型失效的案例。在不精调的情况下,prompt基本上是影响效果的唯一因素了,虽然网上有很多Prompt编写指南,但我认为OpenAI出品的这份,你一定要看一下。 这篇文章就给大家划一下重点。 ChatGPT基操 主要包含在How to work with large language models这个文档里,同时适合网页和API用户。首先,介绍了向ChatGPT提问的三种主要范式,一种是直接给指令,例如 Extract the name of the author from the quotation below. “Some humans theorize that intelligent species go extinct before they can expand into outer…

大力真的有奇迹

在之前那篇颇受欢迎的卖惨小品【今天被OpenAI爆了】里,我讲述了被GPT embedding震撼的故事。但故事的最后,我们并没有采用openai的embedding接口,因为那样确实成本和产品稳定性都不好控制。 我们在一番寻找之后,我们看到了一个叫Massive Text Embedding Benchmark (MTEB)的大型语义表征benchmark(在Huggingface上有最新的的榜单)。并且最终选择了榜单上排名第二的instructor-lg模型。 Instructor-large模型的水平在这个榜单上超过了openai的ada-002,可见开源社区还是很能打的。这个模型基于的是谷歌的T5模型,然后用instruction…

今天被OpenAI爆了

今天第一次体验到来自大语言模型的压力。 最近在做一个语义匹配的小任务,选择的方案是用2021年的SOTA模型SimCSE在我们的领域数据上先进一步预训练,然后再用任务数据finetune降维。前几天的时候还自我感觉良好,因为比之前的模型效果好,还修复了老语言模型的一些明显badcase。 但是今天,我们用openai的embedding模型也试了一下,recall指标直接翻了一倍。当时看到结果我都惊呆了。这个模型一千个token只要0.0004美元,相当的便宜,而且开箱即用。 之前我看到网上帖子说NLP工程师失业啥的还觉得有点夸张,现在感觉还真有可能。 首先这个事情是有正反馈的,作为一款公开的产品,而且这么便宜,你不用别人也会用,你如果没法超过他(现在看起来确实不容易),那就只能也用,不然产品竞争力就会出问题。…

[大模型补课]模型及训练方法

前情提要: [大模型补课]当代AI的基石数据集 [大模型补课]当代语言模型的评价体系 这是大模型补课的第三篇文章,主要关注模型及其训练方法。做算法的人往往最喜欢看模型相关的东西,这期包含的内容也确实很有趣,不需要技术背景也能看懂。 Encoder vs Decoder 在模型层面,我认为大模型时代最重要的一个变化就是从前几年的Encoder为主变成了Decoder Only占据绝对的主流。相对应的,自然语言生成问题取代了自然语言理解问题成为了主流,并且是在用生成这种范式统一了理解问题。 transformer编码器和transformer解码器的主要区别在于它们如何处理输入和输出序列。 {: .align-center style=“width:80%”} 最开始的时候Transformer的Encoder和Decoder是成对出现的 {:…

[大模型补课]模型训练关键工具包

前情提要: [大模型补课]当代AI的基石数据集 [大模型补课]当代语言模型的评价体系 [大模型补课]模型及训练方法 这是大模型补课的第四篇文章,主要关注模型背后的训练工具。 并行:大模型训练的必要手段 如果你使用过多张GPU训练模型,那应该对并行不陌生。最基本并行方式有以下两种 DataParallel数据并行(DP)。这也是最常用并行方法,在pytorch里有DP和DDP两种原生方式,使用起来都很方便。这种并行方式最好理解,模型在每个worker上都有完整的一份,只是给他们喂的数据不同。在每个worker算完后,需要一个同步过程,来综合大家的梯度信息,再更新模型。数据并行主要解决训练速度的问题,可以在单位时间内学习更多的样本。…

Logistic Regression: A Beginner's Guide

Logistic Regression is a statistical method used to analyze the relationship between a categorical dependent variable and one or more independent variables. It is widely used in machine learning and predictive modeling for binary classification problems. In this article, we will discuss the basics of logistic regression and its mathematical formulation. Binary Classification Binary classification…

Linear Regression: Understanding the Basics

Linear regression is a widely-used statistical method for modeling and predicting the relationship between two variables. In essence, it is a technique for finding the best-fitting line through a set of data points. This article provides a beginner-friendly introduction to linear regression and its underlying concepts. What is Linear Regression? Linear regression is a statistical method that…

基础量化策略

以下是一些基本的量化投资策略,它们使用数学模型和算法分析数据并做出投资决策: 价值投资:该策略涉及寻找低市盈率(P/E)或低市净率(P/B)的被低估股票。价值投资者相信市场有时会低估好公司,以折扣购买这些股票可能会带来长期收益。 成长投资:该策略涉及投资于具有高增长潜力的公司,其收益增长率或其他指标证明。成长投资者相信这些公司将继续以比整个市场更快的速度增长,从而在长期内导致股价上涨。 动量投资:该策略涉及购买最近表现良好的股票,出售最近表现差的股票。动量投资者相信股票价格的趋势在短期内将继续,从而导致盈利交易。 统计套利:该策略涉及使用统计模型来识别相关证券的错误定价,然后在这些错误定价上进行交易。例如,统计套利者可能寻找两个价格高度相关的股票在价格上暂时发生分歧的情况,然后打赌价格最终会再次收敛。…

美联储加息周期中一般什么行业的股票会表现更好

美联储加息周期中一般什么行业的股票会表现更好 一般而言,在美联储加息周期中表现良好的行业是那些对利率敏感性较低的行业。这些行业包括: 医疗保健:无论经济情况如何,人们都需要医疗服务,因此医疗保健公司通常对利率变化不太敏感。 消费品:生产食品、家居产品和个人护理用品等消费品的公司在利率上涨期间也往往表现良好,因为人们会继续购买这些基本物品,不受经济条件的影响。 技术:技术公司往往具有高增长潜力,并且不太依赖借贷或利率,因此对利率上涨不太敏感。 公用事业:提供电力和水等基本服务的公司也不太受利率上涨的影响,因为这些服务是不可或缺的,无论经济条件如何。 另一方面,在利率上涨周期中表现不佳的行业是那些对利率敏感性较高的行业。这些行业包括: 金融:银行和其他金融机构在利率上涨周期中通常会遭受损失,因为他们的借贷成本增加,从而减少了利润。…

大规模语言模型的评价方法

上一篇文章介绍了大模型是用什么数据训练的,这一篇文章重点来看大模型的评价方法。Chatgpt这轮出圈很大原因是对话这种评价方式非常直观,普通大众就可以从对话质量看出来现在的模型比之前的"人工智障"要强很多。但真正开发大模型肯定不能用这种方式,不仅效率低、价格高,还存在不小的主观因素。这篇文章就来总结一下大模型的评价方式。 还是先来看LLaMA论文里使用的评价指标。LLaMA里一共使用了**20种数据集(或任务)**来评估和对比模型。这些任务可以分为两大设定:零样本任务和少样本任务,涵盖以下几个大类 常识推断 闭卷问答 阅读理解 数学推理 代码生成 大规模多任务语言理解 下面一一来看。 常识推断 这个任务用了8个数据集,分别是BoolQ、PIQA、SIQA、HellaSwag、WinoGrande、ARC easy, ARC…

如何使用ChatGPT算命

可能是网站slogan:AI算命,朋克养生的关系,最近我看google search console后台总是有很多"Chatgpt算命"这个查询导致的网站展现。 既然大家有这个需求,我就实践SEO里面的方法,上网搜索了一下如何使用chatgpt算命,总结在这个文章里。 好多chatgpt算命的查询 {: .align-caption style=“text-align:center;font-size:smaller”} 基本上,这要用到chatgpt的**“角色扮演”**功能,让它站在算命者的角度回答你的问题。 先从英文开始,英文里算命先生叫做fortune teller,那么我们可以这么问chatgpt Act like a coffee fortune teller, I can see a cat shape in the…

大规模语言模型的基石数据集

最近AI大火,作为一名稍微有点赶不上趟的NLP工程师,感觉有很多课需要补。恰好昨天Meta发了新的大模型论文,浏览了一下发现很适合作为补课的切入点。 今天这部分是关于预训练使用的数据集,是重中之重,说数据是当代AI的基石一点也不为过。GPT3用的数据其实没有公开,Meta这次论文里提到的应该算是开源模型里一个最全的版本。他们使用的数据如下表所示,我们一一来看一下。 Dataset Sampling prop. Epochs Disk size CommonCrawl 67.0% 1.10 3.3 TB C4 15.0% 1.06 783 GB Github 4.5% 0.64 328 GB Wikipedia 4.5% 2.45 83 GB Books 4.5% 2.23 85 GB ArXiv 2.5% 1.06 92 GB StackExchange 2.0% 1.03 78 GB…

ChatGPT未来会拥有自我情感和思维吗?

首先批评一下知乎,类似的问题翻来覆去提。感觉和上次的这个问题很像:https://www.zhihu.com/answer/2869775692 我尝试问了下GPT以下问题,它的回答还挺乐观,哈哈。 我:什么是情感? GPT:情感是一种心理状态,它指的是一种强烈的感情,如欢乐、悲伤、焦虑、愤怒、害怕、爱、厌恶等。它们可以由个人的生活经历、社会环境、文化和道德价值观等因素引起。 我:语言模型,例如GPT是否具有情感? GPT:不具有情感。GPT(Generative Pre-trained Transformer)是一种预训练的自然语言处理模型,它可以帮助机器理解和生成自然语言,但它本身并不具有情感。 我:为什么说语言模型不具有情感?能说得具体一些吗?…