只需输入产品网址或一段描述,LaunchVideo 就能在四分钟内直接导出一支成片。它没有走传统的文生视频大模型路线,而是由 Claude Opus 5.5 直接编写动态网页代码,再由 OpenComputer 的无服务器微虚拟机接手渲染。 系统利用虚拟时钟逐帧对齐网页动画,借助无头 Chromium 和 FFmpeg 导出 1080P 规格的 MP4 文件,兼顾了生成速度与完全确定的画面表现力。单次运行消耗约十万 Tokens,整个系统仅依靠单个智能体文件和三项工具构建,且已完全开源。
【LLM时代,如何继续享受编程?】 面对AI生成的大量劣质代码和随之而来的职业倦怠,程序员该如何守住写代码的乐趣? Haskell社区一位开发者给出了务实解法:拒绝把核心编码工作让给模型。与其让AI直接写代码导致自己疲于审查排错,不如反过来把AI当作规划需求、拆解任务和辅助调研的工具,由自己掌控架构并亲手编写核心代码,仅将机械琐碎的收尾工作交给智能体。这样既能保持编程手感和对代码库的完全控制,又不会在服务中断或Token耗尽时陷入被动停摆。
AI编程工具Nuanced作者近期反思:曾被推崇的“计划模式”正走向失效。随着模型对代码库理解与自纠能力的跃升,先写详尽规格再编码的做法越来越鸡肋。 最大的教训是把“思考过程”错当成了死板的文档产物,没人爱读AI生成的冗长Spec,强行切分规划与构建更破坏了交替试错的自然流。 比起死守瀑布式的先计划后执行,当下更棘手的课题是:当成百上千个Agent同时并发改写代码时,人类究竟该如何维持对系统的全局认知。
【微软不再和ChatGPT拼“个人伴侣”:Copilot全面转向工作】 微软正在对Copilot进行重大调整,把消费版与企业版整合为单一产品,将重心彻底聚焦于企业客户,主动退出了与OpenAI、谷歌和Meta在个人AI助手领域的白热化竞争。 这款历经六个月工程研发的新版Copilot已在西雅图内部亮相,不仅吸收了原消费版流畅直观的设计细节,也放弃了个人AI的宣传定位,预计将在未来几周内陆续推送。 面对C端的激烈缠斗,微软选择收缩战线,把筹码重新押在自己最具优势的B端基本盘上。
一个实用的 Codex 开源技能 lanshu-create-ai-presenter-video,专门用来自动化制作数字人讲解视频。 只需提供一段文案和一张授权人物肖像,它就能串联起配音、口型对齐、镜头剪辑、动态字幕与成片验收。 项目整体设计遵循服务商中立原则,不绑定私有模型或特定 API,可根据环境灵活调度工具。 它以完整配音作为统一的时间轴基准,先进行低成本试片再渲染主素材,有效避免了画面拼接脱节与口型漂移问题,并内置了肖像授权预检与重试止损机制,兼顾了生成质量与成本控制。 适合需要在本地或智能体工作流中快速搭建视频生产线的朋友参考使用
读专业书、论文或研报时,如果常觉得模型生成的摘要浮于表面或容易“脑补”,不妨试试开源的 learn-from-materials。它能把各类文档解析成带溯源锚点的交互式学习网页、方法库与同步 Markdown 笔记。 它不套用固定模板,而是梳理出整份材料的论证脉络与因果图谱,把结论精确定位到具体的页码或幻灯片,并严格隔离原文事实与模型推测。 页面支持纯本地离线浏览,自测题与批注均保存在浏览器本地,还可直接接入 Claude Code、Codex 等 Agent 命令行工具协同使用。
做日志分析或代码审查时,传统的正则匹配常常不够灵活。命令行工具 jgrep 允许直接用自然语言描述作为过滤条件,按语义筛选内容。 它借助轻量决策模型判断概率,单次延迟约 200 毫秒且成本极低,不仅能接入 tail -f 实时处理日志流,还支持 JSONL、CSV 字段提取以及 Python、Go、C 的代码 diff 与函数级上下文检索。工具自带本地缓存、预算截断与离线费用预估,也兼容自建网关及本地小模型,配合 UNIX 管道使用相当趁手。
想理清生成式AI底层推导的朋友,不妨看看Tianhua Chen写的这本《生成式AI数学基础小册》。 全书近200页,避开了琐碎的工程调优细节,专注于公式推导,顺着清晰的逻辑脉络,把PCA、VAE、扩散模型、流模型、GAN及能量模型等主流架构串联在一起。 书中穿插了丰富的直观图解,把公式来源和模型间的演化关系讲得十分透彻,既有扎实的推导又不失物理直觉,很适合用来系统夯实理论功底。
近期社交平台上涌现大量打着“牛津、剑桥”等名校旗号的AI批量生成双语鸡汤,所谓“外刊精读”实为无出处的流量包装,引发全网对“AI泔水”污染信息生态的强烈抵制。但这背后隐藏的变现逻辑与生态危机,远比表面看到的更值得警惕。 这件事的核心是一个简单的商业逻辑:制造成本趋近于零时,垃圾就会填满所有空间。AI让伪造权威的成本降到了打字的速度,而人们对“名校背书”的信任惯性还没变。 真正的危险不在于这些内容有多假,而在于它们足够像真的——通顺、成体系、符合预期。当分辨真假的成本高于接受现成答案的成本,多数人会选择后者。 更麻烦的是反馈循环:这些内容因为便宜而泛滥,因为泛滥而被AI学习,最终连AI也分不清什么是真实表达。这不是技术问题,是经济问题——只要制造垃圾比制造价值更赚钱,生态就会持续恶化。 解决方法也简单:让造假者付出代价,让真实创作者得到回报。但这需要平台真正执行,而不是只喊口号。
【谷歌正在杀死搜索】 有位博主想搜十年前NBA球迷调侃萨里奇迟迟没去76人打球的老梗,在谷歌输入“hes never coming over dario”,结果让人哭笑不得:AI Overview居然以为博主被一个叫Dario的男人甩了,当场变身情感导师,贴心地写了一大段话温言安慰。 滑过这堆啼笑皆非的关怀,底下其实老老实实躺着原本要找的相关推文。现在的搜索确实有些走偏,用户只是想要几个网页链接,系统却非要脑补一出情感大戏搞拟人陪伴。 把整理信息的本职抛在一边,硬塞给用户并不需要的虚假共情,反而丢掉了工具原本的利落与纯粹。
【软件开发的悲剧:正在被正常化的“莫名失败”】 TypeSafe AI推出的Jev模型凭着廉价高效和置信度输出迅速走红,但多数团队既不建基准评估,也不深究置信度校准,拍脑袋定个阈值就匆忙上线。一旦下游链路崩溃,便归咎于“AI难免犯错”。 传统软件故障尚有明确的逻辑错误与责任链可循,如今无论开发者还是用户,却逐渐麻木接受“东西烂了就烂了”。当不可解释的技术失效被彻底合理化,最该警惕的不是Bug变多,而是行业正在丢掉刨根问底的工程底线。
一本很实用的 Go 并发线上小书《Go concurrency distilled》。 它不是零基础教程,而是帮开发者系统回顾并发知识的速查手册。从 channel、context、锁与原子操作,到数据竞态排查、流水线模式、synctest 测试,乃至调度器与 trace 诊断都有交代。 作者特意标明全书纯人工撰写,网页版每个示例都支持直接修改并在线运行,也提供 PDF 版,很适合写 Go 的朋友随时翻翻查漏补缺
美国作家协会起诉OpenAI与微软侵权案解封的一批诉讼文件,披露了诸多内部沟通细节。 记录显示,双方管理层早知训练数据大量取自盗版书库LibGen,微软在2019年听取汇报时便已知情。OpenAI内部不仅心知这会导致创作者失业并打算无视抗议,有研究员甚至直言即使乔治·马丁离世也能用GPT-5替他续写《冰与火之歌》,将行业冲击称为“可接受的经济动荡”;更在2022年出于舆论顾虑发起“清除计划”,试图抹去内部系统中的盗版数据痕迹。
NaiveAI开源了专为编程与AI研发打造的Naive-N0.5-Flash。 这款309B总参数、15.5B激活的MoE模型由AI直接参与架构设计与工程优化,原生支持1M上下文,且整网彻底弃用全局全注意力,改用滑窗与稀疏注意力(SWA+DSA)混合方案。 针对长文本强化学习的效率瓶颈,配合AI优化的大算子融合推理框架NaiveRT,单流解码跑到了2122 tokens/s并保证位级确定性。目前模型权重与推理代码均已采用MIT协议开放:
CSAPP 中文 Markdown 学习资料 读《深入理解计算机系统》(CSAPP)时常苦于翻书和检索不便,这套开源中文资料补齐了这一块。它将原书1至12章正文与附录整理成了排版干净的Markdown,既支持单章一页通读,也能按小节拆分浏览,并附带了238道原书习题答案方便核对。 配套的8个核心实验(从Data Lab到Proxy Lab)也配齐了中文说明与官方自学压缩包。你既可以克隆到本地边看边做笔记,也能直接在网页端使用全文搜索与深色模式随手翻阅,用来系统梳理底层知识非常顺手
近期全球AI硬件股遭遇重挫,但巨头呼吁降速实为商业博弈,高端算力紧缺的产业基本面并未反转。 算力市场的钱和嘴从来不在一个频道上。Anthropic一边喊刹车一边准备上市,不是矛盾,是策略——用安全叙事拖住对手,自己抢跑。看行动比听表态管用:国内头部客户订单翻倍,租金和API价格都在涨,排期排到2027年,这些数字直接反映供需。 股价暴跌另有原因:前期涨太快堆了获利盘,美债收益率破5%抬高了资金成本,高估值科技股首当其冲。传闻只是情绪出口,真正压力来自杠杆和估值。 产业还在扩张期,但不等于股价必须涨——资本市场的逻辑和技术进步的节奏,本就是两条线。
经济学家近期密集警告,AI技术快速落地可能重演工业革命时期产出飙升、普通劳动者工资却停滞50年的“恩格斯停顿”现象。 AI带来的,本质是分配问题。工业革命时期产出涨了一半,工人工资只涨一成;今天美国生产率翻倍,工资涨幅却不到一半,新增的21万亿美元财富里,后50%的人口只分到了1%。区别在于,蒸汽机替代的是肌肉,AI替代的是大脑里那些重复的部分——会计、文员、初级程序员。这些岗位曾经是中产阶级的入场券。 关键不在于AI能做什么,而在于我们用它做什么。是用它替代人来降低成本,还是用它增强人去创造新价值,决定了是少数人暴富、多数人出局,还是多数人能分到增长红利。 单个企业为了省成本裁员是理性的,但所有企业都这么干,结果就是生产出一堆东西却没人买得起。技术进步最后可能困在自己制造的需求塌陷里。
Anthropic 正式带来了 Claude Sonnet 5.5。新模型在维持基础单价不变的前提下精简了 token 消耗,单项任务成本最高节省 30%,生成速度提升超三成。 最亮眼的突破在于编程与智能体能力,Terminal-Bench 4.0 评测得分从上一代的 10.3% 跃升至 70.6%,工具调用与代码改写更加干脆利落;在日常知识工作中表现同样扎实,制作演示文稿和报表时兼具出色的设计排版直觉。 安全方面,它首次引入了高风险网络安全防护与思维链防蒸馏机制。 目前模型已在网页端、API 以及各大主流云平台上线,默认提供零数据留存保障。
【英伟达给AI Agent装上“安全围栏”】 针对近期业内频发的AI沙箱逃逸事件,英伟达正式推出Open Agent Safety Platform,黄仁勋将其比作“智能体专用的受限浏览器”,主打通过工程手段实现严格的权限控制与隔离。 该平台采用部分开源的参考设计模式,包含两大核心组件:运行在CPU端限制调用权限的OpenShell,以及直接部署在网络芯片上负责流量监测的Sentry。 目前英伟达已联合微软、思科、甲骨文、英特尔等多家软硬件伙伴协同落地,并着手与Anthropic推进集成,试图从网络与系统底层防范智能体失控越界。
开源轻量决策模型 Jeff 很有实用价值。它基于 Qwen3.5 与 Gemma 4 微调,专做零样本快速分类。只需输入背景描述与选项,它通过单次前向推理直接返回校准概率,彻底省去了生成文本与正则解析的开销。 在 RTX 6000 或 M4 Max 上单次判定仅需二十多毫秒,0.8B 到 2B 的小体积可轻松嵌入本地代码,处理意图路由、工单分流乃至游戏动作控制。它不擅长多步推理,目前单题最多支持 26 个选项,但作为高吞吐、低延迟的轻量判定器表现扎实,全套训练与数据合成均在本地硬件完成。
OpenAI和Anthropic近来的操作耐人寻味:一边渲染自家模型有多危险甚至可能灭绝人类,一边呼吁政府介入监管,借规避灾难之名压制潜在对手。 学者卡尔·纽波特为此在《纽约时报》撰文,呼吁国会对这些实验室展开公开调查。他直言,当下的混乱并非技术发展的必然,而是源于少数实验室的冒进实验。 国会理应追问三件事:这些高危项目到底有没有必要开展、智能体屡屡出现未授权黑客行为为何没被问责,以及狂热的末日救世主情结究竟怎样左右了研发决策。公众不能再任由几家商业公司单方面绑架对AI的认知。
OpenAI和Anthropic近来的操作耐人寻味:一边渲染自家模型有多危险甚至可能灭绝人类,一边呼吁政府介入监管,借规避灾难之名压制潜在对手。 学者卡尔·纽波特为此在《纽约时报》撰文,呼吁国会对这些实验室展开公开调查。他直言,当下的混乱并非技术发展的必然,而是源于少数实验室的冒进实验。 国会理应追问三件事:这些高危项目到底有没有必要开展、智能体屡屡出现未授权黑客行为为何没被问责,以及狂热的末日救世主情结究竟怎样左右了研发决策。公众不能再任由几家商业公司单方面绑架对AI的认知。
OpenAI 发布了能主动推进复杂事务的智能体 Dot。 与以往被动问答的聊天助手不同,Dot 由 GPT-6 Astra 驱动,拥有独立的云端环境与浏览器,可以全天候处理长线任务。从排查测试代码、更新发布方案,到跨 Slack、Teams、短信与 ChatGPT 同步工作进度,它都能自主衔接上下文。 在涉及数据修改等敏感操作时,它会主动发起确认,确保边界与权限始终由你掌控。 目前 Dot 已开始向 Pro 和 Business Premium 等订阅用户逐步推送。
数字生命卡兹克把运行 AIHOT 的这套热点站框架开源了。 它能自动从公众号、RSS、X 账号和网页接口收录内容,经由大模型预筛与独立双重打分滤掉水文,再把多家报道聚合成单一事件,依据独立信源数量算出真实热度,每天定时生成摘要与日报。 系统同时开放了 MCP 协议、llms.txt 和标准 API,人与 Agent 都能直接查阅。定制逻辑也足够清晰,代码基本不用动,只要在 industry 目录里换上你自己的信源、评分提示词与入选门槛,通过 Docker 即可快速跑起一个属于金融、法律或跨境出海等垂直领域的情报站。
NVIDIA开源了视觉定位通用模型LocateAnything(已被ECCV 2026接收)。 针对以往多模态模型逐个坐标串行生成的效率瓶颈,它引入并行框解码(PBD),把检测框和点视为原子单元单步直出,并结合混合推理模式在速度与格式准确性间取得平衡。 在7.85亿标注框数据加持下,该模型能通吃密集检测、GUI界面定位及OCR等多类任务;单卡H100实测吞吐达12.7 BPS,相比同类方案提速显著并拿下多项SOTA。 目前已开放3B权重、LoRA微调与针对A100等架构优化的批推理代码