RSS Amplifier

Blog

V2EX - 创意

way to explore

v2ex.comSource feed ↗15 posts

Live Last read · last published · next check

Latest posts

受够了视频没听清就反复拖进度条,只考虑音频错别字多,写了个"会看画面"的视频转笔记工具

看视频经常一句话没听清,拖回去重听好几遍还是听不清。试了现有的转写工具,发现它们只用音频——恰恰是我听不清的词,它们也转不对(幻灯片上的术语、代码里的名词,声音里根本猜不出来)。 所以做了 Vid2notes :转写时不只听声音,还抽帧看画面。Whisper 转文字,多模态模型拿着字幕对着截图一起读,输出带截图、章节、时间戳和 AI 总结的图文笔记,可导出 Markdown / SRT / VTT 。 支持最长 10 小时的视频,常见格式都行。 技术栈给感兴趣的 V 友:全栈 Cloudflare ( Workers AI 跑 Whisper + GLM ,Rust + FFmpeg 跑在 Containers 里),按视频 MD5 缓存不重复算。 每天免费 3 个视频 ,不用绑卡: vid2notes 最想知道的反馈:准确率在你的视频上怎么样,尤其是带幻灯片/代码的教学视频。欢迎拍砖…

垂直领域 Coding 场景意图识别模型开放权重与 API 使用

最近在基于 PI Agent 构造属于自己的 hermes ,其中有一环就是需要根据意图进行针对性的调优,例如不同的场景使用不同的思考深度,还有如果是 Plan 转 Edit 或者 Review 转 Plan 可以进行 Compact ,这里也可以针对性的压缩过程保留不同的细节(有的保留复现过程,有的可以只保留结论) 于是针对性的买了一点数据集和搜集了一些高质量的样本集训练出了一个 0.6b 的可供 CPU 推理的向量模型,目前使用了半个月(在公司内部网关实现了 Auto 智能路由),准确度可达 70-75% 左右,大幅节省了成本,同时模型也在 HF 开放了权重,以及在我个人的一台物理机上部署了公益 API ,欢迎大家测试和部署,希望大家也可以多多提出意见。 关于模型的细节,可以从 HF 的模型卡进行查看,我这里稍微注意几点: 模型的底座是…

做了一个在线 Lip Sync 工具,想听听大家的体验反馈

最近做了一个 AI Lip Sync 网站: https://lipsync.vip 主要想解决一个比较直接的需求: 给一张人物、宠物或者其他角色图片,配上音频,让图片里的角色根据语音生成自然的嘴型同步效果。 之前自己测试类似产品的时候,发现几个比较影响体验的问题: 嘴型和声音容易对不上 生成过程中人物会莫名转头、表情变化太大 中文、英文等不同语音下效果差异比较明显 很多工具上传完素材之后,操作流程比较复杂 想快速做一个短视频 Demo ,往往还要来回调很多次 所以这次做 lipsync.vip 的时候,我比较希望它保持简单: 上传素材 → 添加音频 → 生成 Lip Sync 视频 目前也做了一些可以直接测试的示例素材,包括: Social Media Creator UGC / Lifestyle Podcast / YouTube Music / Singing 宠物 Vintage…

做了一个学习 Skill:先摸底,再定制生成课程, AI 出课程出题并阅卷评分

做了一个 skill ,Adaptive Learning Course 。 地址: https://github.com/sosplit/adaptive-learning-course 一个面向 AI Agent 的学习工作流:先了解学习目标、已有基础和时间安排,再生成针对性的摸底测试,根据实际答题结果制定课程计划。计划需要用户确认,之后每次只生成当前要学的一课。 课程可以通过本地网页呈现,支持随堂题、代码题、答卷提交。Agent 读取答卷后会逐题批改,并根据掌握情况决定进入下一课还是安排复习。对于不能运行本地服务的 Agent ,也提供静态导出和纯对话模式。 可以直接对 Agent 说: 使用 adaptive-learning-course 帮我设计并开始一套个性化学习流程。

Davflare:用 Cloudflare R2 给自己搭一个带 WebDAV 的网盘

Davflare 是跑在 Cloudflare Pages + R2 上的自建网盘:网页管文件、WebDAV Class 1/2 、再加一套开放 API 。免费档大概 10 GB 存储、每天 10 万次 Worker 调用。 从 FlareDrive fork 而来,已经完整重写。 GitHub: https://github.com/fanchenggang/Davflare 一键部署: https://deploy.workers.cloudflare.com/?url=https://github.com/fanchenggang/Davflare 首次部署后把 R2 绑到 BUCKET ,设好 WEBDAV_USERNAME / WEBDAV_PASSWORD ,再部署一次。 接口说明:…

一个定制的 OpenClaw 的云端托管平台

上半年 openclaw 火的时候,做了一个云端托管平台给周边朋友用; 断断续续优化了几个月,感觉已经很好用了,发布出来,有兴趣的童鞋可以来试试 主要特点: 0.定制版 openclaw ,写了一个好用的 web 工作台界面 1.每个用户的 openclaw 跑在一个 2GB 的云端电脑,注册启动就可用 2.微信/飞书/telegram 一键扫码连接 3.搜索/图片生成/tts/asr/股票数据等各个服务已经集成 4.可以做网站直接发布(基于 cloudflare 的基础设施) 5.最近接入了 minimax h3 做视频生存 6.目前每天有 1000 万-2000 万 deepseek flash v4 免费额度(具体多少看缓存率) 网址: https://xiaoxia.app 邀请码: clever-robin-7292 gleeful-hawk-6138…

# Otterflow:对话只是一个开始

通用大模型发展到今天,我们发现 agent ,已经可以解决了大部分场景的能力,在通用的场景下,通用的模型仅通过对话而不需要帮助你关注过程,就能得到一个完整接近符合你预期的一个结果,这种感觉近乎于“造神”。 但是这只是 AI 发展到现在的第一步! “‘对话模式’不是 AI 交互的最优解~!” 这个是我们思考并提出来一个观点,无论是什么领域,完整的一条属于自己垂类领域的 workflow 和 AI 的交互都有一套自己的标准,它不仅仅只是聊天,更是对于自己领域的整理、管理与沉淀。 每个行业都有自己的工作流程。做科研的、做设计的、做开发的,流程完全不同,需要看到的东西也完全不同。但不管哪个行业,应该都希望能有一个东西,把 AI 和人的每一次交互里真正有价值的部分沉淀下来,用某种方式呈现出来——可能是进度图,可能是知识图谱,可能是一个你随时可以拖拽时间轴回去看的画板。 关键是,AI…

Agenton: v0.6.3 新增本地用量统计 - Windows 用户必备小工具

这版主要是把「额度」和「用量统计」拆成了两页: 额度页:各服务商的会话/周额度进度条,展开能看今日花费、30 天累计和当前活动状态 仪表盘(新):本地统计的 token 用量 —— 模型占比环图、贡献热力图、按日分模型的 柱状图,支持今日/本周/本月/本年切换 下载地址: https://agenton.xmagicer.com/

做了一个参考图生成图片的网页工具,想听听大佬们的反馈

最近在整理一个很具体的问题,顺手把它单独做成了一页:Image to Image Generator 。 这一页主要想解决的是: 让已经有参考图的用户,在网页里说明想改变和保留的内容,确认当前设置,生成新图,并在下载前复核结果。 当前这版更偏向“先把第一步走顺”,而不是一次把所有材料都堆进去。现在这页大致会带着用户走这几步: 上传一张 JPEG 、PNG 或 WebP 参考图;符合条件的多图流程可以组合 2 到 5 张图。 用提示词说明希望改变什么,也尽量写清楚哪些主体、结构或细节需要保留。 确认当前支持的模型、比例和分辨率后提交生成。 查看任务进度,复核主体、构图、细节和瑕疵,再决定下载或调整请求。 做这个的时候我有个取舍: 我没有继续堆更多模型入口,而是先把参考图、提示词、当前设置、生成状态和结果复核连成一条路径。多图的重点也不是数量,而是每张图的角色和保留条件能不能讲清楚。…

最近开了 grok bot,在高强度使用和研究,做了个小站

https://www.usebot.net/zh/ 梳理了一些教程和方法,方便理解,看看对大家有没有用。 还在持续迭代中

免费模型延迟,一眼就看明白!

一个免费模型测评网站,由于 DeepSeek 涨价,不得不另寻他路,发现各种小厂如雨后春笋的长起来了,里面有一些蛮不错的模型,qwen3.8-flash 、deepseek-v4-flash 等模型延迟都不一样,所以汇集在 fm 站点里,方便实时查看 最后发现还是孙哥的牛 https://fm.ggball.top

又 vibe 了一个自我感动的玩具小程序

拍照识别猫(也可拍狗/鸟)→ 前端生成像素卡片 → 收进图鉴。 截图 太阳码,欢迎体验

horsie 0.5.0 添加了中文支持

Horsie 是一个开源的 cloud agent 实现,刚刚发布了 0.5.0 ,添加了中文支持。欢迎大家试用、反馈! 项目地址: https://github.com/blossomstack/horsie

[送码] 耗时两个月制作的 ai 生图网站,帮忙看看方向

最开始做这个网站的初衷是为了电商使用的,但是功能开发到后面,感觉很多都是伪需求,所以没有在这一块继续做,现在成了一个偏通用的生图工具,不知道后面该做了,希望大家给一些工具和营销方向。 现有功能:web 端生图、还支持了 MCP 、DeepSeek Harness 的识图插件、OpenApi 接口 注册会赠送积分,只允许了常用邮箱注册、google 、github 登录 功能 生图: 现在支持 GPT-image-2 + 提示词 生图 人物发型设计 MCP: 只有识图功能的 MCP ,最初也是给 dsh 用的,只不过 ds 自己出了多模态,就不再推进了,后续可能会给 MCP 增加生图的功能 DSH 插件 识图的另外一个实现方向,深度接入 DSH ,使用体验和支持多模态的一样 OpenAPI 也是识图的开放接口 技术栈 采用的前后端分离,前端部署到 cloudfalre…

卧槽,前天第一、昨天第四,今天 Archify 又回到 GitHub Trending 第一了,感谢这段时间帮忙的 V 友们

前几天 Archify 第一次排到 GitHub Trending 第一的时候,我在 V2EX 发过一篇帖子。 本来以为这一波热度很快就过去了,结果前天第一,昨天掉到第四,今天又重新回到了第一。 刚刚重新看了一下 GitHub 。写这篇帖子的时候,项目已经突破了 2.8 万 Star ,还有 1773 个 Fork 。Trending 页面显示今天新增了 4562 Star 。 下面这张榜单图是稍早接的,当时项目还是 2.6 万 Star ,结果过了没多久又涨了快两千。 更离谱的是,我自己的 GitHub Trending 开发者排名也到了第一。 一年前的这个时候,我才刚毕业,工作上也挺迷茫的。现在看着自己做的项目排到 GitHub Trending 第一,自己也到了开发者榜第一,还是会觉得挺恍惚的,有一种非常不真实的感觉。 Archify 是一个给 Agent 使用的架构图生成项目。…